跳到正文
arXiv cs.AI· Lucas Jing, Xinqi Wang, Liao Zhang, Simon S. Du·· 9 小时前AI 评分30

PBT-Bench:在基于属性的测试上评测 AI 智能体

PBT-Bench: Benchmarking AI Agents on Property-Based Testing

AI 导读

PBT-Bench 是一个覆盖 40 个真实 Python 库、100 道基于属性测试题的基准,每题注入语义 bug 共 365 个(平均 3.65 个),默认随机输入几乎无法触发。

来源:arXiv cs.AI · arxiv.org