跳到正文
arXiv cs.AI· Ritvij Sharma, Russell Dlugosz, Ryan Zhou, Maheep Chaudhary·· 11 小时前AI 评分29

LLM 纵深防御:评估记忆门控对激活诱导与记忆诱导谄媚的防御效果

Defense-in-Depth for LLMs: Evaluating Memory Gates Against Activation-Induced and Memory-Induced Sycophancy

AI 导读

研究提出一个 2×2 纵深防御框架,将内部激活引导与外部记忆处理分离,在 MemSyco-Bench 上评估四种开放权重模型。

来源:arXiv cs.AI · arxiv.org