arXiv cs.AI· Shuangjie Yao, Hao Wang, Koushik Sen, Simin Chen, Baishakhi Ray, Dawn Song·· 3 小时前AI 评分41
TestJack:编码基准测试结果可信吗?通过评估器演化审计 Agentic Coding 基准
TestJack: Should you trust the results in coding benchmarks? Agentic Coding Benchmarks Auditing via Evaluator Evolution
AI 导读
TestJack 是一个通过评估器演化审计 Agentic Coding 基准的框架,针对每个 trial 生成针对提示词要求的测试,仅保留 ground-truth patch 通过的测试并重新检查失败 trial。
来源:arXiv cs.AI · arxiv.org