跳到正文
arXiv cs.AI· Oliver Jaffe, Dane Sherburn·· 9 小时前AI 评分51

TasteVal:用算力效率衡量 AI 系统的实验研究品味

TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts

AI 导读

研究者提出 TasteVal 基准,用于评估前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并从结果中得出结论的能力。该基准将实验研究品味操作化为算力效率,包含 8 个开放式任务,模型作为 Researcher 设计实验、由固定 Coder agent 实现并反馈结果,预算为 40 H100 小时或 120 小时挂钟时间。

来源:arXiv cs.AI · arxiv.org