arXiv cs.AI· Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng, Boyi Li, Thomas Tian, Zheng Lian, Yan Wang, Jiaqi Ma, Boris Ivanovic, Marco Pavone, Wenhao Ding·· 10 小时前AI 评分32
VeriFine:通过协同进化策略、课程与评判器扩展具身推理的自改进验证
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
AI 导读
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。
来源:arXiv cs.AI · arxiv.org