跳到正文
arXiv cs.LG· Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li·· 5 小时前AI 评分38

用强化犹豫让语言模型学会弃权:Reinforced Hesitation 将「我不知道」变为协调信号

Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

AI 导读

研究者提出 Reinforced Hesitation(RH),将 RLVR 的二值奖励改为三元奖励(+1 正确、0 弃权、-λ 错误),在逻辑谜题、MATH Levels 4-5 和医疗 QA 上训练出沿帕累托前沿分布的模型:低惩罚倾向激进作答,高惩罚倾向保守弃权。

来源:arXiv cs.LG · arxiv.org