arXiv cs.LG· Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li·· 5 小时前AI 评分38
用强化犹豫让语言模型学会弃权:Reinforced Hesitation 将「我不知道」变为协调信号
Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
AI 导读
研究者提出 Reinforced Hesitation(RH),将 RLVR 的二值奖励改为三元奖励(+1 正确、0 弃权、-λ 错误),在逻辑谜题、MATH Levels 4-5 和医疗 QA 上训练出沿帕累托前沿分布的模型:低惩罚倾向激进作答,高惩罚倾向保守弃权。
来源:arXiv cs.LG · arxiv.org