跳到正文
arXiv cs.CL· Vineet Kumar, Darshita Rathore, Anindya Moitra·· 3 小时前AI 评分36

所有判定并非等价:重新审视 LLM Judge 的可靠性

All Verdicts are Not Equal: Rethinking LLM Judge Reliability

AI 导读

一项针对 LLM-as-a-Judge 的可靠性审计发现,六个前沿模型在四个基准上即使温度为 0 重复评测,判定结果仍会变化,位置顺序互换会翻转多数判定,最确定的评判模型仅靠重复错误判定实现完美一致性,与真实标签一致率仅 51%。

来源:arXiv cs.CL · arxiv.org