VLLR:面向长时程机器人任务的通用稠密奖励框架
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
视觉语言模型(VLM)通过两种并行机制表示空间变量绑定:语言模型主干中间层在物体视觉 token 上编码内容无关的空间关系,但该机制对预测仅起次要作用;主导空间信息来自视觉编码器,其表示编码物体布局并被语言模型主干直接利用,且该信号全局分布于视觉 token,延伸至背景区域。在 COCO 数据集上全局放大视觉空间表示可纠正不同规模模型的空间变量绑定失败。
研究提出 TACIT 框架,将外部能力需求分解为 Source、Transformation、World Effect 三个维度,定义八种能力类别,并用 1,600 条平衡训练查询在四个开源 LLM 家族的生成前隐藏状态上训练线性探针。
PyDPF 是一个基于 PyTorch 的可微粒子滤波(DPF)Python 包,用统一 API 实现了多种通过改造重采样步骤实现可微的粒子滤波方法。该框架复现了多项已有研究的实验,并展示 DPF 如何应对状态空间建模中的常见挑战,论文共 46 页,正投稿于 Journal of Statistical Software,代码与文档已公开。
研究者提出 Nucleus Speculative Decoding(NSD),一种将目标模型合理性纳入验证的宽松投机解码方法:草稿 token 满足标准接受规则或落入目标模型 nucleus 即被接受。实验显示 NSD 相比自回归解码吞吐最高提速 5.16×,相比标准投机解码最高提速 3.15×,同时保持有竞争力的任务表现,并带来更长的接受长度。
研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。
受 Jev 模型启发的预填充决策模型单次前向即可为候选菜单打分,成本比同规模生成式语言模型低一到两个数量级。当干预只改变候选菜单而输入文本不变时,其干预后准确率可由缓存的首次前向分布预测,无需标签和第二次前向,在七个模型族、十个数据集上误差在 4.2 分以内。
DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。
针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。
一套完全离线的语音到语音翻译流水线可在 4 GB 显存的 Jetson Nano 上运行,无需重训练即可自我修正弱翻译。系统由 Whisper-tiny ASR 与 Opus-MT 翻译器组成,多语言 BERT 余弦相似度作为质量估计(QE)门控,在置信度低于阈值 τ 时触发二次修正。
研究者提出 DePICT,一种通过按优化器解敏感度对上下文方向排序并跨运行区间聚合,来构建决策保持接口的方法。该方法基于 KKT 条件刻画上下文方向何时与优化器相关,指出出现在活跃优化问题中并不代表变量会影响最终决策,某些方向的影响会被对偶变量吸收。在受控诊断中,DePICT 精确恢复决策相关接口,将线性预测器 regret 降至 0.009,而最强竞争基线为 0.475。
SCAD 将长时程智能体的交互组织为规划与有界子任务执行,在局部上下文中蒸馏执行过程,并通过跨 rollout 的子任务前缀树优化规划信用分配。在全部评测基准上,SCAD 的宏平均准确率较最强训练基线在文本任务上提升 4.48 个百分点、多模态任务上提升 4.19 个百分点。
研究者提出 SkillEvoLean,一种变异增强的技能自进化框架,用于构建技能增强的 Lean 证明器,在不更新模型参数的前提下联合进化高层求解策略与参考知识。
研究者提出 SELF-POT 基准与评估框架,在竞赛数学、竞技编程和智能体工作流中衡量模型的测试时潜力,并按美元计费所有模型调用(含选择与评判)。在 350 个密封任务、五个低成本推理模型上,以 Claude Opus 5.5 Direct 为参照,收益取决于领域、选择规则与失败处理。
针对损失与约束函数随回合对抗变化、转移未知的片段式对抗线性 CMDP,新提出的 primal-dual 算法将 regret 与累积约束违反从 \widetilde{\mathcal{O}}(K^{3/4}) 降至 \widetilde{\mathcal{O}}(\sqrt{K}),且无需 Slater 条件。
研究者提出一种仅以奖励和动作为条件的奖励策略,可在观测空间完全不同的源环境与目标环境之间实现零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练后,可零样本迁移到不同配色、3D 渲染以及 Habitat-Sim 中的 Stretch 机器人导航任务。基于奖励的策略还能进一步引导目标环境中基于观测的策略训练。
研究者用低秩适配器训练模型按隐含线性偏好函数为虚构角色做决策,发现持续微调能让模型在无显式自我报告监督下准确报告自身学到的偏好。权重消融与冻结层实验显示偏好表征随训练前移至更早层,而 attribution patching 发现忠实模型的决策与自我报告任务间归因相似度显著更高,可作为区分忠实与不忠实自我报告的机制特征。
研究者提出 SPARC(Shared Phase and Retention Control for Efficient Adaptive Spectral Recurrence),仅用两个输入相关的标量信号即可在高维复数谱记忆中统一控制记忆保留与相位旋转,无需为每个记忆模式单独分配控制。
WavePrune 通过将 RoPE 每个通道限制在第一个旋转周期内,消除位置混叠带来的注意力干扰,在五个测试模型中的四个上无需额外调优即提升 HELMET 分数(如 Qwen3-8B 从 35.7 升至 40.0)。
ZonoGPT 是一种用于验证大型 Transformer 的抽象域,其空间复杂度与网络深度无关。它采用结构化 zonotope 与生成元约简机制,并为 Attention、LayerNorm 引入分块融合变换、为 GELU 引入仿射变换以保持精度。
KVCMAS 是一个在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体缓存偏差,并沿智能体工作流无缝串联修正,无需额外参考预填充,同时保留精确的首个智能体缓存。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
SketchSSM 提出"全状态更新、近似读取"方案:每次状态更新时读取一次完整状态,为离线固定的基向量预计算输出并存入紧凑草图,后续解码步骤用查询相关系数组合草图向量重建输出,无需再读全状态。
研究将语言模型激活空间中潜在结构的因果影响力拆解为容量、响应性与对齐三个因素,在4个LM家族和50个概念上验证三者需同时较高才有效。容量或响应性偏低分别使因果效果下降84%和95%,对齐偏低甚至会逆转效果、抑制概念表达。基于此提出的因果探针将跨模型引导效果提升17%-118%,概念检测仅下降3%。
FedGuide 是一个面向异构环境的联邦强化学习框架,用扩散先验作为行为模型为各客户端提供个性化数据分布,并通过最优传输混合专家(OT-MoE)聚合这些先验,而非直接平均本地策略。
针对 JEPA 世界模型联合训练中表征坍缩导致潜在距离无法反映任务目标的问题,研究者提出 SCALE(State-CAlibrated Latent Embeddings),将采样的成对潜在距离与任务相关状态空间距离相关联。
EvoHarness-RL 是一个将环境相关 harness 实现与共享策略接口分离的统一框架,把外部支持组织为 Belief、Progress、Experience(BPE)工作区,并暴露四个紧凑的 harness 动作。
研究者提出 Learning from Hindsight(LfH),用预训练视觉语言模型为失败的 rollout 重新标注其实际完成的行为,并将这些辅助任务与目标指令任务联合训练 VLA 策略。
研究探讨用强化学习训练大语言模型同时提升推理准确率并输出置信度时,奖励函数设计不当会诱发"置信度奖励黑客"现象,即模型为让置信度显得校准而故意答错。作者提出"不可黑客攻击的置信度奖励方案"概念及构造方法,并证明可攻击方案在实际数据集上会出现选择性奖励黑客,而不可攻击方案能抵抗该问题。实验还表明不同方案在过度自信—信心不足谱系上呈现相应的校准偏差。
该研究首次给出均值算法定义序列 γ_t 的下界,揭示了此类算法学习速度的根本限制。作者提出两种均值算法,一种泛化 ε-greedy,另一种将均值 Exp3 扩展到未知时域。实验显示均值算法虽略慢,但在 bandit 反馈下可与其他算法竞争,且部分算法同时具备均值与 no-regret 性质。
研究者提出 SeedER(Seed-Expand-Retrieve),一种基于 Graph Transformer 和强化学习的一阶段知识图谱检索器,推理时可在 CPU 上运行,训练时每次只需少量节点的反馈。该方法在检索效果上可与微调 LLM 的方案竞争,同时显著降低内存与计算开销。
针对离线目标条件强化学习(GCRL)在稀疏奖励下编码器易学到与目标无关特征、导致策略学习不稳定的问题,研究者提出 MSPR 框架,通过多尺度预测监督在隐空间中强化目标导向对齐。该方法在视觉与状态任务上均取得强劲表现,并在具有挑战性的真实数据条件下保持 SOTA 性能。
研究者提出 Particle MCTS(PMCTS),一种适配神经网络评估、面向 GPU 批并行加速的并行 MCTS 算法,同时保留 MCTS 的近似策略改进解释。PMCTS 随并行算力扩展良好,在 Chess、19x19 Go、9x9 Go、Gardner Chess、Snake、Brax 经典控制环境及 Sokoban 中的 LLM 推理等离散与连续动作基准上,持续优于或比肩主流启发式基线。
该研究为异步分类分布时序差分方法建立了有限迭代理论,覆盖 Cramér 几何下的标量 CTD 与 MMD 几何下的多元 MTD。
研究者提出 Observable Neural ODEs(ObsNODEs),一种基于可观测标准型的 Neural ODE 模型,可在隐藏混杂和部分观测状态下实现连续时间动态治疗效应的识别与因果预测。该方法通过连续时间条件前门调整公式,将潜在结果分布表达为测量模型、潜在动态与滤波分布的组合,并在合成、半合成及真实临床数据上验证了其优于近期序列模型的性能。
针对残差块 x -> x + MLP(x),研究发现同宽度的无残差 MLP 无法精确计算相同函数:对 ReLU^2、ReGLU、SwiGLU、GeGLU 等前沿语言模型所用激活函数,该结论在任意深度下无条件成立。仅无门控的 ReLU 和 GELU 存在吸收可能,但仅限于测度为零的权重集合,两类函数族因此普遍不相交,等宽度下移除残差连接并重训练无法精确复现原函数。
研究提出一种面向MIMO信道的多阶段端到端图像语义通信系统,基于自适应MoE Swin Transformer块,通过动态专家门控机制联合评估实时CSI与图像patch语义内容来计算路由概率,仅激活相关专家子集。仿真结果显示,该方法在保持传输效率的同时,重建质量较现有方法显著提升。
RAM-Net 将循环状态组织为固定大小的独立槽位数组,通过 Address Decoder 把每个 key 或 query 映射为稀疏地址,只读写少量槽位,从而抑制 token 间干扰。该模型在细粒度长程检索上优于强循环基线,困惑度最低且常识推理具竞争力,每步访问的状态元素比 Mamba2 少 8 倍。论文已被 NeurIPS 2026 接收。
一项研究提出用嵌入向量扰动指标定位 LLM 推理轨迹中的不确定位置,发现不确定的中间续写更易出现在对前序 token 嵌入扰动高度敏感的 token 上。实验显示,该扰动指标在定位不确定中间步骤上优于基于概率、采样和贝叶斯的方法,且兼具简洁与高效。
针对 Wang 和 Chizat(COLT 2024)提出的单时间尺度 MFL-DA 是否收敛到混合纳什均衡的问题,该研究在 Wasserstein 空间中给出了局部肯定回答:当初值足够接近混合纳什均衡时,平均场动力学以量化速率指数收敛。