arXiv cs.AI· Aleksi Huotala, Miikka Kuutila, Mika M\"antyl\"a·· 3 小时前AI 评分27
LLM 在软件工程系统综述中的筛选性能是否已停滞?
Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?
AI 导读
研究基于 SESR-Eval 基准评估了 8 个新 LLM 在软件工程系统综述筛选任务上的表现,平均 MCC 仅从旧模型的 0.347 微升至 0.365,提升有限。LLM 之间筛选决策一致性较高(平均 Gwet's AC1 = 0.830),细化纳入排除标准仅小幅提升召回率。研究认为 LLM 尚无法替代人工筛选,更昂贵新模型带来的优势十分有限。
来源:arXiv cs.AI · arxiv.org