跳到正文
热点事件持续更新

研究者提出Reinforced Hesitation训练方法

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

Mohamad Amin Mohamadi等作者提出Reinforced Hesitation(RH),把可验证奖励强化学习(RLVR)的二值奖励改为三元奖励:答对得+1、弃权得0、答错扣λ。 据该研究,在逻辑谜题、MATH Levels 4-5和医疗QA上训练出的模型沿帕累托前沿分布:惩罚较低时倾向激进作答,惩罚较高时倾向保守弃权。

AI 根据报道生成 · 8 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.LG
    用强化犹豫让语言模型学会弃权:Reinforced Hesitation 将「我不知道」变为协调信号

    研究者提出 Reinforced Hesitation(RH),将 RLVR 的二值奖励改为三元奖励(+1 正确、0 弃权、-λ 错误),在逻辑谜题、MATH Levels 4-5 和医疗 QA 上训练出沿帕累托前沿分布的模型:低惩罚倾向激进作答,高惩罚倾向保守弃权。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。