arXiv cs.AI· Youwei Feng, Yitong Zhang, Yuetong Liu, Jia Li·· 3 小时前AI 评分31
仅靠安全动作不足以保障智能体安全:用 Guard 模型识别未履行的义务
Safe Actions Alone Do Not Ensure Safe Agents: Identifying Unfulfilled Obligations with Guard Models
AI 导读
针对 LLM 智能体安全,研究指出仅识别禁止动作并不够,还需识别未执行的安全关键动作即"义务"。在热门安全基准上,56.92% 的 GLM-5.3 轨迹含未履行义务,远高于含禁止动作的 30.00%。
来源:arXiv cs.AI · arxiv.org