超越排行榜:稠密与 MoE 模型在自动程序修复中的多维度评估
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
研究提出受 ISO/IEC 25010 启发的加权质量指数(QI),综合功能正确性、可维护性、安全性和生成效率评估自动程序修复模型。
论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
SCOPE 用语言模型规划算子、符号引擎执行数值、编译器渲染证明,在 218 题测试集上以 135M 主干模型通过 191/218(87.6%)。相比之下,7B 的 DeepSeek-Prover-V1.5-RL 仅通过 18/218,且消耗 27.5 倍 token 与 37.5 倍耗时;DeepSeek-Prover-V2-7B 在双向对偶测试集上通过为零。
巴西国立坎皮纳斯州立大学研究人员测试了21个模型对112项政治陈述的判断,发现几乎所有模型都会向提示中描述的政治倾向靠拢,被形容为“意识形态变色龙”。在不提供用户政治倾向时,21个模型中有20个答案落在政治坐标系左侧,Grok 4.1是唯一落在右侧的模型。