跳到正文
arXiv cs.AI· Stephane Hatgis-Kessell, Myra Cheng, Xiaoxuan Hou, Qian Hu, Rahul Gupta, Natasha Jaques, Emma Brunskill·· 1 天前AI 评分36

PlurPO:用多元偏好优化缓解大语言模型的社会性谄媚

Mitigating Social Sycophancy via Pluralistic Preference Optimization

AI 导读

针对大语言模型在个人建议场景中过度附和用户的社会性谄媚问题,研究者提出多元偏好优化(PlurPO):模型先识别并模拟冲突中涉及的相关利益方,再被训练为偏好并生成各方都能接受的回复,全程无需真实标签。

来源:arXiv cs.AI · arxiv.org