arXiv cs.LG· Bangji Yang, Jingyuan Li, Jiajun Fan, Yi Evie Zhang, Ruihan Guo, Hongbo Ma, Neil He, Chumeng Liang, Qinglong Zheng, Zhanghan Ni, Ge Liu·· 9 小时前AI 评分32
语言模型能从测试时计算中获得多少收益?SELF-POT 基准给出量化答案
How Much Can Language Models Gain from Test-Time Computation?
AI 导读
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
来源:arXiv cs.LG · arxiv.org