arXiv cs.LG· Lars Simon, Holger Eble, Manuel Radons·· 3 小时前AI 评分24
让推理模型学会规划:基于后见之明的层级式自我改进方法
Learning to Plan by Looking Back: Hindsight Hierarchies for Training Reasoning Models
AI 导读
研究者提出一种推理模型自我改进循环:即使问题难度超出模型当前能力,额外提供解答也能让模型事后提取有用的解题思路。方法让同一模型同时训练三种能力——仅凭问题预测思路、从问题与已知解答反向推导思路、以及利用给定思路解题,并在反向推导与联合训练之间交替。论文给出形式化定义及在 Lean 定理证明器中的具体实例,实证评估留待后续工作。
来源:arXiv cs.LG · arxiv.org