跳到正文
arXiv cs.AI· Ayushi Chadha·· 3 小时前AI 评分21

分数不等于策略:衡量自适应修订的价值

A Score Is Not a Policy: Measuring the Value of Adaptive Revision

AI 导读

研究在分层潜在推理器中考察元层控制问题:管理者可保留或替换约束下层计算的承诺。在三个预训练种子上,学习到的修订时机产生了从近乎确定性的早期时钟到状态条件化调度分布等不同策略,但均未超过在同一冻结检查点上评估的最佳强制时机策略。反事实 PERSIST/REPLAN 诊断表明,当可预测性由决策位置而非位置内区分主导时,分数层面的证据可能具有误导性。

来源:arXiv cs.AI · arxiv.org