arXiv cs.AI· Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter·· 11 小时前AI 评分22
面向 LLM 回归的预测分布强化学习:Distribution-Aware Reward 方法
Reinforcement Learning over Predictive Distributions for LLM Regression
AI 导读
研究者提出 Distribution-Aware Reward(DAR),一种 on-policy 强化学习目标,通过联合评估同一输入下多次预测形成的经验预测分布,并按留一法贡献为每个预测分配奖励。在合成插值/外推任务及代码、分子两个真实科学回归任务上,DAR 相比监督微调和逐点强化学习降低了预测误差、提升了排序质量,并给出校准更好的不确定性估计。
来源:arXiv cs.AI · arxiv.org