arXiv cs.AI· Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin·· 10 小时前AI 评分27
ImplicitRM:从隐式反馈学习无偏奖励模型用于 LLM 对齐
Unbiased Reward Modeling from Implicit Feedback for LLM Alignment
AI 导读
针对现有奖励模型依赖昂贵显式反馈的问题,研究者提出 ImplicitRM,可从点击、复制、跳过等隐式用户反馈中学习无偏奖励模型。该方法用分层模型将训练样本划分为四个潜在组,并推导出理论上无偏的似然最大化目标,以解决隐式反馈缺乏明确负样本和存在选择偏差两大挑战。
来源:arXiv cs.AI · arxiv.org