跳到正文
arXiv cs.AI· Xingru Zhou, Luis Sentis, Aarti Choudhary·· 9 小时前AI 评分23

SAFESHIELD:面向小语言模型部署时安全的决策组织框架

SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models

AI 导读

SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。

来源:arXiv cs.AI · arxiv.org