跳到正文
arXiv cs.AI· Aleksi Huotala, Miikka Kuutila, Mika M\"antyl\"a·· 3 小时前AI 评分27

LLM 在软件工程系统综述中的筛选性能是否已停滞?

Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?

AI 导读

研究基于 SESR-Eval 基准评估了 8 个新 LLM 在软件工程系统综述筛选任务上的表现,平均 MCC 仅从旧模型的 0.347 微升至 0.365,提升有限。LLM 之间筛选决策一致性较高(平均 Gwet's AC1 = 0.830),细化纳入排除标准仅小幅提升召回率。研究认为 LLM 尚无法替代人工筛选,更昂贵新模型带来的优势十分有限。

来源:arXiv cs.AI · arxiv.org