arXiv cs.AI· Stephane Hatgis-Kessell, Myra Cheng, Xiaoxuan Hou, Qian Hu, Rahul Gupta, Natasha Jaques, Emma Brunskill·· 1 天前AI 评分36
PlurPO:用多元偏好优化缓解大语言模型的社会性谄媚
Mitigating Social Sycophancy via Pluralistic Preference Optimization
AI 导读
针对大语言模型在个人建议场景中过度附和用户的社会性谄媚问题,研究者提出多元偏好优化(PlurPO):模型先识别并模拟冲突中涉及的相关利益方,再被训练为偏好并生成各方都能接受的回复,全程无需真实标签。
来源:arXiv cs.AI · arxiv.org