O*NET-BENCH审计套件评估LLM裁判
热点事件观察中
O*NET-BENCH审计套件评估LLM裁判
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
研究团队发布 O*NET-BENCH 审计套件,用于评估大语言模型(LLM)裁判在职业 AI 测量中的表现。该套件基于一项涵盖 45,796 份工人评分的既有调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。 结果显示,33 种配置中有 25 种的配对准确率(pair accuracy)达到 0.60 以上,排序表现与人类一致;但评审给出的可接受回答比例在 3.0% 至 97.9% 之间,而职业匹配工人的接受率为 61.1%,说明 LLM 裁判在判断回答是否可接受时严重失准。 该研究由 Harry Lyu 和 Neil Thompson 发布,结论指向 LLM 裁判可用于相对排序,但其绝对接受率不能直接采信。
AI 根据报道生成 · 14 小时前更新
最新进展10月5日 12:00
研究:LLM 评审在职业 AI 测量中排序一致但接受率严重失准报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv cs.AI研究:LLM 评审在职业 AI 测量中排序一致但接受率严重失准
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。