跳到正文
arXiv cs.CL· Steven Denney, Matthew DiGiuseppe·· 5 小时前AI 评分22

JEV 对比 LLM:七项政治学复现任务上的准确率、成本与校准

JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications

AI 导读

研究将 TypeSafe 宣传的 "System One" 模型 JEV 与 GPT-6 Luna、Qwen3.8-27B 及已发表研究中的人类编码员在七项政治学复现任务上对比,发现 JEV 准确率与两款 LLM 相当或接近。

来源:arXiv cs.CL · arxiv.org