跳到正文
arXiv cs.AI· Xuancheng Li, Beining Wang, Haitao Li, Heng Wang, Yujia Zhou, Qingyi Pan, Blaze Chen, Yiqun Liu, Min Zhang, Qingyao Ai·· 12 小时前AI 评分24

EnGRICH:用人类批评增强生成式奖励模型

EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans

AI 导读

研究者提出 GRM 训练框架 EnGRICH,通过一个从少量人类批评中学习的训练期 MetaCritic,为生成的批评构建针对性评分标准并评估其证据覆盖度与正确性,从而提供过程奖励和结构化探索引导。MetaCritic 在训练中进一步优化,将人类评价标准泛化到仅有结果标签的偏好数据;推理时训练好的 GRM 独立运行。在七个奖励模型基准上,EnGRICH 持续优于竞争基线。

来源:arXiv cs.AI · arxiv.org