研究:奖励模型记忆偏好数据中的捷径
热点事件持续更新
研究:奖励模型记忆偏好数据中的捷径
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一项新研究通过反事实记忆测量发现,判别式训练的奖励模型(RM)会把记忆错误集中分配到简单、高margin的偏好对上,并记住数据集特有的捷径,例如模型身份和用户采样策略。 面对未见过的偏好对时,这类RM会过度泛化长度、合规性等简单启发式关联。作者据此认为,RM尚无法在上下文相关场景中判断回复质量。 该研究由Ivo Verhoeven等作者发表,测量对象为两个人类偏好数据集。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
奖励模型记住了什么?研究揭示判别式训练导致奖励模型产生偏见报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CL奖励模型记住了什么?研究揭示判别式训练导致奖励模型产生偏见
研究通过反事实记忆测量发现,判别式训练的奖励模型(RM)会将记忆错误分配到简单、高margin的偏好对上,并记住数据集特有的捷径(如模型身份、用户采样策略)。面对未见过的偏好对时,RM还会过度泛化长度、合规性等简单启发式关联,导致其尚无法在上下文相关场景中判断回复质量。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。