arXiv cs.LG· Kemou Li, Zhuan Shi, Qizhou Wang, Fengpeng Li, Negar Rostamzadeh, Golnoosh Farnadi, Jiantao Zhou·· 3 小时前AI 评分32
LLM Persona Unlearning:PersonaUnlearnBench 基准与 PaCE 方法
LLM Persona Unlearning
AI 导读
研究提出 PersonaUnlearnBench,一个覆盖 3 个模型家族 6 个 LLM、5 种人格的配对基准,用于评估权重层面的人格遗忘。实验显示标准遗忘方法难以在不损害生成质量与通用能力的前提下可靠抹除目标人格,为此作者提出 PaCE,通过对比目标与理想回答定位内部行为方向,将目标提示状态推离目标模式,在中等效用代价下稳定抑制目标人格。
来源:arXiv cs.LG · arxiv.org