跳到正文
arXiv cs.AI· Zhankai Ye, Yanning Wang, Yukai Jin, Bo Mei, Fangyi Li, Wei Wang, Shangqian Gao, Xin Liu·· 3 小时前AI 评分32

叙事包装如何影响 LLM 拒答:跨语言基准与防御方法

How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense

AI 导读

研究发现安全对齐模型会拒绝直接表述的有害请求,却会回答被角色扮演或叙事包装后的同一请求:Qwen3-1.7B 上的攻击成功率在英文中已达 89.4%,现代中文为 93.0%,文言文则达 95.7%。

来源:arXiv cs.AI · arxiv.org