跳到正文
arXiv cs.CL· Igor Slinko, Yaroslav Golubev, Sergey Titov·· 4 小时前AI 评分29

研究:Coding-Agent 基准测试应匹配用户真实任务流

Coding-Agent Benchmarks Should Match Their Users' Task Flows

AI 导读

研究收集 JetBrains IDE 中 4,782 个真实软件工程师的 agent 会话(Production Sessions),发现长会话的任务类型远比 issue 衍生基准任务更广,且用户会在会话中切换任务类型。

来源:arXiv cs.CL · arxiv.org