跳到正文
arXiv cs.AI· Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman·· 9 小时前AI 评分37

JEV-as-a-Judge:置信时接受,不确定时升级

JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

AI 导读

JEV-as-a-Judge 提出用只输出标签概率的决策型评判模型 JEV 做评估,由置信度决定直接采纳还是升级给推理型评判模型。在 16 个生成式与奖励模型评判器的对比中,JEV 在可直接从文本读出结论的场景下与 GPT-6 相差 3 分以内,费用仅为其 0.36%,中位延迟 0.15 秒,但在数学、代码和逻辑等需推导结论的场景落后。

来源:arXiv cs.AI · arxiv.org