arXiv cs.AI· Harry Lyu, Neil Thompson·· 1 天前AI 评分31
研究:LLM 评审在职业 AI 测量中排序一致但接受率严重失准
Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
AI 导读
研究团队发布 O*NET-BENCH 审计套件,基于 45,796 份工人评分调查,在 4,501 条测试评分上评估了 6 个模型家族的 33 种评审配置。25 种配置的 pair accuracy 达到 0.60 以上,但评审给出的可接受回答比例在 3.0%-97.9% 之间,而职业匹配工人的接受率为 61.1%。
来源:arXiv cs.AI · arxiv.org