RELACE:面向长程语言智能体的基于回顾似然的动作信用估计
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。
研究者提出 SAG(Self-improving Agent with Gated critique),一种成本感知框架,将批评调用建模为长程交互中的逐步决策问题,通过全局熵与局部 top-2 margin 等动作级歧义信号实现免训练门控,近似批评的信息价值(VoI)。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。
研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。
开源对比决策模型 Contrastive-LM/CLM-v0.1-8B 在公开评测基准上表现接近随机:在 RM-Bench 和 JudgeBench 上与抛硬币无统计差异,在 HaluEval 上对所有条目输出同一标签,与 always-first 基线持平于 0.581。
研究发现,LLM 评审在候选回答顺序调换时可能改变判定,而判定前的残差流激活可预测这种位置翻转。在 JudgeBench 的 534 对样本上,针对三个 Qwen3 评审和 Llama-3.1-8B 训练的线性探针 AUROC 达 .621-.850,比结合语言化置信度、判定标签 logits、回答长度和初始选择的基线高 .062-.113。
研究提出推荐系统递归自我改进(Rec-RSI)中的"分布式进展"问题,并用跨代优势(CGA)量化跨代与同代模型对的差异。在四个数据集和三种序列推荐编码器上,GRU4Rec 和 SASRec 更适合跨代配对,FMLP 首次更新偏向同代配对、第二次更新后转向跨代配对;秩分离统计在 12/12 首次更新和 5/6 第二次更新设置中选出更强模型族,留出测试中 34/36 条轨迹优于直接后继模型。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
研究者提出 macro2mind,用 GRPO 结合预测市场价格信号训练语言模型,将行为推理拆解为推断市场参与者群体、预测其信念更新并聚合为价格的显式步骤。该方法在 SWM-Bench 的 Polymarket 数据上取得 SOTA 方向准确率与相关性,并零样本迁移至 Humanual、OvertonBench、PRISM、CAD 四个用户模拟基准。
TRIAGE 是一种方向感知的稳定方法,通过段级诊断选择性再平衡策略梯度更新,并对残余严重失配做有界修复,从而在采样器和学习器上保留原生 NVFP4 的 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,该方法在整个训练周期内保持稳定优化,在五个数学推理基准上达到全精度水平,rollout 吞吐量较 BF16 最高提升 2.3 倍。
研究将知识蒸馏与量化联合应用于法译英生物医学翻译,蒸馏并量化的学生模型相比原始基线体积缩小69%、推理速度提升98.21%、CO2排放降低98.46%,且未牺牲翻译质量。该工作还开发并比较了多种微调策略,以让压缩后的学生模型适应专业术语密集、平行语料稀缺的低资源领域。
研究对 Qwen2-Audio 上的加性音频越狱方法 AdvWave-P 进行频率与解码深度审计,在 520 条 AdvBench 提示上主评判器将 76.7% 的对抗输入标记为越狱。
研究者提出免训练方法 MaskAhead,用单一掩码查询排序机制同时完成块扩散语言模型的 KV 选择与淘汰,当前块掩码指导选择、后续掩码块探测指导淘汰。
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
研究者提出一种通过行为克隆训练的 System-1 决策算子,默认版本仅用 330K 参数即匹配 1.33M 参数的强化学习算子,并将 3,685-token 的推理压缩为 6-token 决策且不损失准确率。
AttSVD 提出一种免训练的低秩 KV Cache 压缩方法,通过对每个提示词自身的注意力几何做在线截断 SVD,只保留注意力真正读取的方向,将每头持久 KV 内存按保留秩成比例削减。
研究将 LLM 的拒绝行为引导分解为组件级干预,在四个开源权重模型中发现拒绝方向集中于仅占上游组件 28–48% 的稀疏子集,仍保留 88–101% 的引导效果。在这些机制内部,有效引导进一步集中于约 50% 的残差流维度,保留 85–98% 的组件机制基线效果。团队已开源全部代码与原始实验结果。
针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。
针对工业控制系统中 APT 与 MTD 随机博弈的均衡计算难题,研究者提出动态低秩均衡计算(DLR-NE),通过逐迭代扩展秩 r 搜索空间、正则化核心矩阵谱并经截断 SVD 回缩,每步提取 Nash 均衡。
研究提出预算自适应神经算子求解框架,用全局 Fourier 神经算子推进全场、局部算子提出分块残差修正,并由 set-aware 选择器决定精修位置,宏观策略决定何时花掉剩余精修预算。
研究将 Random Forest + XGBoost + Logistic Regression 集成做中智学分解,在 CWRU 和 JNU 两个轴承基准(600-1000 rpm)上以留一工况协议评估 T-hat、F-hat、预测熵 I1-hat 与决策分歧 I2-hat 四项指标。
一篇 arXiv 论文提出在固定物理域、明确实验目录、传感器不确定性和采集预算下形式化"定律还原"问题,用率失真逆定理区分描述定律所需信息与仪器可揭示的信息。
研究系统评估了 10 个推理模型在 LLM-as-a-Judge 中的设计选择影响,涵盖句子情感与毒性评分(每类超 500 条)及问答对二元准确率分类(n=600)两项任务。
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。
研究者推出 WorldSolver 基准,包含 168 个源自 61 篇经典计算机图形学论文的仿真任务,覆盖 7 个物理领域,要求 LLM 智能体补全求解器代码。评测从执行检查、视觉保真度和物理合理性三个维度展开,GPT-5.6-Sol 与 Claude-Opus-5 表现相对最好,总分仅为 48.7% 和 46.7%。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
研究者提出并行预测世界模型(PPWM),可并行预测有限时程轨迹,同时保留未来表示之间的因果交互,从而去除自回归 rollout 中逐状态解码反馈路径。在四项视觉控制任务上,PPWM 取得最低的长时程预测误差和最高的 CEM 模拟器成功率,CEM 规划速度平均超过自回归 LeWM 基线 3 倍以上。
研究者提出 Adaptive Power Sampling(APS),一种无需训练的 LLM 推理采样方法,按查询动态调整锐化指数,依据答案一致性与模型自奖励的关系在测试时逐查询设定。在 MATH500、HumanEval 和 GPQA 等推理任务上,APS 一致优于固定锐化指数的 power sampling,且无需额外训练。
AnyBottle 提出一种构建紧凑、任务专用概念瓶颈模型(CBM)的方法,仅需冻结骨干网络和无监督概念池(如稀疏自编码器),由黑盒教师模型引导逐轮筛选概念,候选限定在师生分歧区域。
研究提出 Effective-Evidence Self-Distillation(EESD),将执行相关性支持与证据量分开表示,用 Dirichlet 后验生成不确定性惩罚权重用于 KL 锚定的纠错学习。
AssemState 是一个零样本家具装配框架,通过锚点引导的边界装配状态将手册页面分解为单部件操作并恢复装配树,再用迭代后状态反馈精修引导 SE(3) 位姿更新与修正,并通过仿真释放测试验证物理合理性。
针对黑盒 LLM 个性化中用户专属评分头导致参数量随用户数线性增长的问题,研究者提出 Mixture-of-Facets(MoF)框架,将用户偏好建模为共享潜在偏好分面的组合,通过历史条件路由在共享分面头上实现个性化。MoF 无需额外参数更新即可泛化到训练中未见的用户,在多种个性化任务上取得更强性能,同时保持更可扩展、更参数高效的设计。该工作已被 EMNLP 2026 接收。
研究团队完成了庞加莱猜想的 AI 辅助 Lean 4 形式化,项目起步时几何分析方向可复用的形式化基础设施十分有限。他们用数学家编写的证明蓝图配合明确的里程碑陈述来组织工作,使多个智能体可并行推进,并让数学家能定位阻塞点、给出有效数学指导。该工作分析了这一流程背后的人工介入与组织选择,为未来形式化项目提供了可复用基础设施的起点。
MedZERO 是一个面向开放式医学推理的自进化框架,由负责生成前沿医学题目选项的 Examiner 和借助外部知识工具进行多轮循证推理的 Reasoner 组成,并采用受控知识积累机制维护临时探索知识与精选持久知识。
SCOPE 用语言模型规划算子、符号引擎执行数值、编译器渲染证明,在 218 题测试集上以 135M 主干模型通过 191/218(87.6%)。相比之下,7B 的 DeepSeek-Prover-V1.5-RL 仅通过 18/218,且消耗 27.5 倍 token 与 37.5 倍耗时;DeepSeek-Prover-V2-7B 在双向对偶测试集上通过为零。
zkLLMPoT 是一个零知识框架,通过前向评估而非验证优化轨迹来证明训练后检查点的审计属性,认证成本与训练迭代次数无关。该框架分两阶段:训练方固定架构并提交权重,审计方选择挑战序列后,训练方证明模型在这些序列上的目标值。在四类模型家族上,1.1-1.5B 参数模型证明耗时 41-59 秒,13B 模型为 131 秒,序列长度 512 时验证时间低于半秒。
LeanPlan 是首个用 LLM 生成启发式函数并对其可采纳性进行机器校验、从而找到最优规划的系统。它通过智能体循环借助规划器反馈迭代改进领域专用启发式函数及其可采纳性证明,并在 Lean 4 中实现启发式、证明与高效规划器。
研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。
研究发现,上下文先验在提升神经到语言解码候选分数的同时,会让残留错误变得更自信。在 MEG-MASC 上,区分修复与残留错误的 AUROC 从初始排名 2-3 时的 0.70 降至排名 21-50 时的 0.39,而排名 20 之后的错误占融合后全部错误的 46.6%。分别读取局部与先验分数可改善选择性解码,解码器在 74.5% 的窗口作答(原为 56.7%),92% 的输出集仍包含正确候选。