跳到正文
arXiv cs.CL· Ivo Verhoeven, Pushkar Mishra, Ekaterina Shutova·· 4 小时前AI 评分32

奖励模型记住了什么?研究揭示判别式训练导致奖励模型产生偏见

What do Reward Models Memorize?

AI 导读

研究通过反事实记忆测量发现,判别式训练的奖励模型(RM)会将记忆错误分配到简单、高margin的偏好对上,并记住数据集特有的捷径(如模型身份、用户采样策略)。面对未见过的偏好对时,RM还会过度泛化长度、合规性等简单启发式关联,导致其尚无法在上下文相关场景中判断回复质量。

来源:arXiv cs.CL · arxiv.org