跳到正文
arXiv cs.LG· Yibo Zhang, Tianrong Guan, Liang Lin, Puze Wang, Jin Wang, Qingsong Wen·· 9 小时前AI 评分36

多轮 LLM 的答案侧后门攻击:模型自生成触发词绕过安全拒答

The Model Plants the Trigger: Answer-Side Backdoor Attacks in Multi-Turn Large Language Models

AI 导读

研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。

来源:arXiv cs.LG · arxiv.org