跳到正文
热点事件观察中

O*NET-BENCH审计套件评估LLM裁判

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

研究团队发布 O*NET-BENCH 审计套件,用于评估大语言模型(LLM)裁判在职业 AI 测量中的表现。该套件基于一项涵盖 45,796 份工人评分的既有调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。 结果显示,33 种配置中有 25 种的配对准确率(pair accuracy)达到 0.60 以上,排序表现与人类一致;但评审给出的可接受回答比例在 3.0% 至 97.9% 之间,而职业匹配工人的接受率为 61.1%,说明 LLM 裁判在判断回答是否可接受时严重失准。 该研究由 Harry Lyu 和 Neil Thompson 发布,结论指向 LLM 裁判可用于相对排序,但其绝对接受率不能直接采信。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.AI
    研究:LLM 评审在职业 AI 测量中排序一致但接受率严重失准

    研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。