跳到正文
arXiv cs.AI· Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng, Boyi Li, Thomas Tian, Zheng Lian, Yan Wang, Jiaqi Ma, Boris Ivanovic, Marco Pavone, Wenhao Ding·· 10 小时前AI 评分32

VeriFine:通过协同进化策略、课程与评判器扩展具身推理的自改进验证

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

AI 导读

VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。

来源:arXiv cs.AI · arxiv.org