跳到正文
热点事件持续更新

审计发现LLM评审判定不稳定

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

一项针对 LLM-as-a-Judge(用大模型充当评审)的可靠性审计发现,六个前沿模型在四个基准上即使温度为 0 重复评测,判定结果仍会变化;交换候选答案的呈现顺序会翻转多数判定。作者 Vineet Kumar 等人据此提出可信判决率(T)指标,用于衡量评审可靠性。 审计还发现,表现最“确定”的评判模型仅靠重复同一错误判定就实现了完美一致性,但其判定与真实标签的一致率只有 51%。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CL
    所有判定并非等价:重新审视 LLM Judge 的可靠性

    一项针对 LLM-as-a-Judge 的可靠性审计发现,六个前沿模型在四个基准上即使温度为 0 重复评测,判定结果仍会变化,位置顺序互换会翻转多数判定,最确定的评判模型仅靠重复错误判定实现完美一致性,与真实标签一致率仅 51%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。