arXiv cs.AI· Ramin Pishehvar, Andrea Morandi, Mahesh Viswanathan·· 9 小时前AI 评分31
评估 LLM 路由的升级信号:目标、对照与五种自欺方式
Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself
AI 导读
研究测试语义熵作为 LLM 路由升级信号,在 GSM8K 上以约 12 倍规模差的小/大模型组合实现 AUROC 0.871,同等成本下路由准确率较随机升级最高提升 9 个百分点。作者指出合成基准上的亮眼结果实为假象:仅基于问题难度的无模型规则几乎完全匹配语义熵,并据此提出一套检查清单,涵盖难度对照、升级成功定义分歧、基准天花板及实时采样真实成本等陷阱。
来源:arXiv cs.AI · arxiv.org