研究者提出Reinforced Hesitation训练方法
热点事件持续更新
研究者提出Reinforced Hesitation训练方法
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
Mohamad Amin Mohamadi等作者提出Reinforced Hesitation(RH),把可验证奖励强化学习(RLVR)的二值奖励改为三元奖励:答对得+1、弃权得0、答错扣λ。 据该研究,在逻辑谜题、MATH Levels 4-5和医疗QA上训练出的模型沿帕累托前沿分布:惩罚较低时倾向激进作答,惩罚较高时倾向保守弃权。
AI 根据报道生成 · 8 小时前更新
最新进展10月7日 12:00
用强化犹豫让语言模型学会弃权:Reinforced Hesitation 将「我不知道」变为协调信号报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.LG用强化犹豫让语言模型学会弃权:Reinforced Hesitation 将「我不知道」变为协调信号
研究者提出 Reinforced Hesitation(RH),将 RLVR 的二值奖励改为三元奖励(+1 正确、0 弃权、-λ 错误),在逻辑谜题、MATH Levels 4-5 和医疗 QA 上训练出沿帕累托前沿分布的模型:低惩罚倾向激进作答,高惩罚倾向保守弃权。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。