arXiv cs.CL· Ivo Verhoeven, Pushkar Mishra, Ekaterina Shutova·· 4 小时前AI 评分32
奖励模型记住了什么?研究揭示判别式训练导致奖励模型产生偏见
What do Reward Models Memorize?
AI 导读
研究通过反事实记忆测量发现,判别式训练的奖励模型(RM)会将记忆错误分配到简单、高margin的偏好对上,并记住数据集特有的捷径(如模型身份、用户采样策略)。面对未见过的偏好对时,RM还会过度泛化长度、合规性等简单启发式关联,导致其尚无法在上下文相关场景中判断回复质量。
来源:arXiv cs.CL · arxiv.org