arXiv cs.AI· Xingru Zhou, Luis Sentis, Aarti Choudhary·· 9 小时前AI 评分23
SAFESHIELD:面向小语言模型部署时安全的决策组织框架
SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models
AI 导读
SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
来源:arXiv cs.AI · arxiv.org