arXiv cs.CL· Amit Nautiyal·· 4 小时前AI 评分27
BehaviorTrace:在线 RL 训练数据归因的局限与评估清单
Which Rollout Taught It That? BehaviorTrace and the Limits of Training-Data Attribution in Online RL
AI 导读
研究团队发布 BehaviorTrace 开源评估工具,用于检验在线 RL 微调中训练数据归因方法是否真实有效。在 Qwen2.5-1.5B 上以 GRPO 训练三个随机种子后发现,仅按梯度大小排序的对照方法达到随机水平的 4.2 至 4.5 倍,并在三个种子中的两个上匹配或超越最佳定向估计器;模型流畅度在饱和检查点上对行为标签的预测能力不亚于任何梯度方法。
来源:arXiv cs.CL · arxiv.org