跳到正文
arXiv cs.AI· Hang He, Li Wang, Hao Chen, Yuchen Shao, Yuling Shi, Lisheng Wang, Peiyang Liu, Goose Lin, Zaiyuan Wang, Haiying Sun, Ting Su, Chengcheng Wan·· 9 小时前AI 评分24

CheckerBench:长时程智能体能否合成静态分析检查器?

CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?

AI 导读

研究者推出 CheckerBench,一个由 297 个 CVE 衍生出 300 项任务的可执行基准,覆盖 167 个仓库、85 个 CWE 和五种语言生态,用于评估智能体能否从零完成静态分析检查器开发。

来源:arXiv cs.AI · arxiv.org