无需世界模型的世界属性:分布关联与语言模型解码结果的解读
静态词嵌入在四项已发表案例中复现了 LLM 激活的线性解码结果:预测地点坐标与死亡年份(R² = 0.42-0.59)、区分疼痛与对照句(held-out AUC 0.85-0.88)、对十二种情绪故事分类(AUC 0.84-0.88)。
静态词嵌入在四项已发表案例中复现了 LLM 激活的线性解码结果:预测地点坐标与死亡年份(R² = 0.42-0.59)、区分疼痛与对照句(held-out AUC 0.85-0.88)、对十二种情绪故事分类(AUC 0.84-0.88)。
ReLoop 通过结构化生成与行为验证两项机制,解决 LLM 生成优化代码时"可求解但语义错误"的静默失败问题。结构化生成将代码生产拆为理解、形式化、合成、验证四阶段,在 RetailOpt-190 上配合 Claude Opus 4.6 提升 8.5pp 准确率;行为验证借助求解器参数扰动检测残留错误,在 MAMO-ComplexLP 上提升 4.4pp。
针对 PPO、GRPO 等 RL 算法在离策略训练多轮 LLM 智能体时优化不稳定、易性能崩溃的问题,研究者提出 SORL 框架,并实例化出 SO-PPO 与 SO-GRPO 两种算法。
研究者提出量子比特中心 Transformer(QCT),一种基于 Transformer 架构、采用量子比特中心注意力机制的通用量子纠错解码器,通过专用嵌入策略将稳定子域的 syndrome 转换为量子比特中心 token,并引入融合量子码拓扑结构的图掩码方法。
LHM-Humanoid 提出一种无需重置的长时程人形运动控制方法,让物理仿真人形在单次连续运行中反复完成走向物体、全身平衡抬起、绕过障碍搬运并放置的完整循环。
FedCoT 是一个联邦推理框架,通过轻量级 CoT 重采样配合紧凑判别器筛选,并用客户端感知的 LoRA 堆叠与加权分类器聚合来应对数据异构、降低聚合噪声和通信开销。客户端本地生成候选推理链与监督信号,服务器仅聚合轻量模块,数据始终保留在本地。在医疗推理基准上,该方法在紧张资源预算下取得稳定提升,代码已公开,论文被 EMNLP 2026 收录。
研究提出用选择性状态空间模型(Selective State Space)的深度神经网络建模光学动态范围压缩器,性能超过此前的循环层方法。该架构结合 Feature-wise Linear Modulation 与 Gated Linear Units,按外部参数动态调节压缩的 attack 和 release 阶段,适合低延迟实时音频处理。
研究者提出超图增强双卷积神经网络(HED),构建包含用户—捆绑、用户—物品、捆绑—物品交互及用户内、捆绑内关系的完整超图,并将完整超图传播与用户—捆绑分支耦合。在 NetEase 上 HED-128 在六项指标上较最强基线提升 5.04–6.97%,在 Youshu 上 HED-64 提升 1.87–4.56%。消融实验支持用户—捆绑分支与类型内关系的贡献,并量化了完整超图的内存开销等计算代价。
研究者提出 GRM 训练框架 EnGRICH,通过一个从少量人类批评中学习的训练期 MetaCritic,为生成的批评构建针对性评分标准并评估其证据覆盖度与正确性,从而提供过程奖励和结构化探索引导。MetaCritic 在训练中进一步优化,将人类评价标准泛化到仅有结果标签的偏好数据;推理时训练好的 GRM 独立运行。在七个奖励模型基准上,EnGRICH 持续优于竞争基线。
SpecFold 通过折叠注意力与 FFN 复用父分支计算,减少扩散语言模型多分支投机验证中的冗余开销。在两类 DLLM 家族、五个模型和五个基准上,其吞吐量最高达 Spiffy 的 1.64 倍、原生解码的 1.99 倍,且任务性能相当。该算法与时间缓存正交,兼容现有 DLLM 投机策略。
研究团队基于 Revised PSVT:R 测试 GPT-5.6 的 3D 旋转空间推理能力,并叠加图形与上下文特征评估不同 CoT 策略的影响。结构化 CoT 在 PSVT:R 及带坐标系数据集上均提升了 GPT-5.6 的表现,三种 CoT 方法(结构化 CoT、few-shot 结构化 CoT、带自优化提示词的结构化 CoT)之间无显著差异。
研究对比 Laya、Jev 和 Qwen2.5-7B-Instruct 在候选集与任务变化下的拒绝策略迁移表现,发现源域校准常无法保持目标工作点:在 DBpedia 上校准的 Jev 策略会拒绝 69.3% 的 Emotion 测试输入,而 Emotion 策略则完全丧失检测能力。
研究者提出 TradeGrad,一个经验引导的文本梯度框架,用于稳健的量化交易策略优化,通过积累的优化经验估计文本梯度,并对策略探索与精炼进行多尺度修正。该框架还引入 Cross-Period Robust Objective(CPRO),强调在不利历史时期的表现以提升时间稳健性。
研究者提出诊断框架 LUMOS,基于训练语料完全透明的 OLMo 2,追踪 LLM 参数化知识从训练数据曝光到行为输出的因果链。结果显示模型内部对罕见事实的编码可分性达 84%,但行为表达仅 54%,该检索差距随规模扩大而收窄。模型对已训练内容自我反思准确率为 83%,对未见内容降至随机基线 49%,且链式推理提示只会抬高置信度而非改善校准。
BitNest 是一种位嵌套投机解码框架,将低精度草稿模型直接嵌入高精度目标模型的权重表示中,两者共享同一份物理权重,并把渐进精度设计扩展到 KV cache 以支持长上下文推理。
SpikeMoE 将神经元尺度的脉冲动力学与模型尺度的专家选择相结合,提出受海马 CA1 区竞争抑制机制启发的脉冲 k-WTA Router,通过侧向抑制和不应期按离散脉冲计数选择 Top-K 专家。该框架还配备两阶段缺失模态建模模块,在视觉、语言和多模态基准上达到 SNN 基线中的 SOTA,性能匹配或超越 ANN 对应方案,并在多种缺失模态条件下保持稳健。
ReSolve 是一种免训练推理方法,通过选择性生成式审核复用候选推理:当候选答案分歧或无法解析时,调用模型检查已有推导并纳入有界循环。在 130 道竞赛数学题上,ReSolve 在两个独立候选池中分别答对 100 和 99 题,优于同四候选投票的 91 和 92 题,且相比八样本自一致性分别少用 46.3% 和 47.2% 的 token。消融实验显示移除可见推导后准确率从 100 降至 93。
一项研究提出 LLM 叙事框架,将时序 SHAP 证据与历史市场状态类比结合,用于横截面股票收益预测的可解释叙述。在 Qwen3 上的对照实验显示,逐步外化数值与关系推理后,Qwen3-32B-Instruct 的证据忠实度从 0.696 提升至 0.996,时序与关系准确率同步改善。历史类比虽未提升结构化自动忠实度,但获得了更高的人工评分有用性。
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
论文提出"动作塑形"原理:可训练策略会吸收其输出层能精确复现的动作偏移,被吸收的偏移可在部署时移除且回报不变。最小实例是学习门控后的零初始化线性头,门控会自行先升后降,在 20 个任务上移除该头几乎无代价。该吸收条件取决于精确复现而非容量,非线性头即使参数更多也不会被吸收。
研究软状态表示中类权重构造与状态动态如何共同决定线性预测精度,针对任意固定可测表示推导出有限样本下最小总体均方根预测误差的置信下界,该下界由独立评估对计算、无需拟合预测矩阵。
JEV-as-a-Judge 提出用只输出标签概率的决策型评判模型 JEV 做评估,由置信度决定直接采纳还是升级给推理型评判模型。在 16 个生成式与奖励模型评判器的对比中,JEV 在可直接从文本读出结论的场景下与 GPT-6 相差 3 分以内,费用仅为其 0.36%,中位延迟 0.15 秒,但在数学、代码和逻辑等需推导结论的场景落后。
UnitBoost 提出用定义好的元级算子替代复合 LLM 系统中的生成式管理者模型,通过任务给定的 unit map 将 worker 输出转为槽值提案,再用受限 argmax 组装输出,未填充或不支持的槽位成为下一轮的显式残差。
GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。
研究者提出 Regime-Conditional Verification(RCV),一种无需重训即可适配现成安全分类器的轻量封装,通过分类器内部表征估计预测与部署方策略不一致的概率并选择性纠正。
研究者提出拒绝门控解码(RGD),一种顺序解码方法,可在高温采样下保留模型的贪心解码拒绝响应,同时让其他提示词按原始高温分布采样。在 7 个模型和 3 个基准数据集上、T=2.0 时,RGD 将贪心拒绝保留率从直接采样的 91.9% 提升至平均 98.3%,非拒绝请求的中位延迟仅增加 2.2-4.3%。其残差流变体将延迟开销降至最多 0.5%,路由准确率相当。
Critic Experience Bank(CEB)是一个免训练框架,将已完成轨迹的反馈转化为可复用证据,用于 LLM 智能体的步级置信度估计。它通过为动作打上事后生产力伪标签并检索相关经验,让固定 LLM 评论模型在无需参数更新或真实步级标签的情况下适应任务流。
一项研究对比人类与 46 个 LLM 的日常常识推理表现,发现两者呈现趋同的推理模式。通过分析内容不变与内容敏感的模型神经元,研究发现真正让模型输出与人类对齐的是内容敏感机制,而非内容不变的世界模型。这表明人类和 LLM 的日常因果推理都大量依赖模式匹配。
研究提出"通道转换"机制解释 LLM 多轮交互中的指令遗忘:目标定义 token 通过注意力变得难以访问,但目标信息可能保留在残差表示中。团队提出 Goal Accessibility Ratio(GAR)指标,结合滑动窗口消融与残差流探针,在 Mistral 上强制关闭注意力通道后,20 项事实回忆任务准确率从接近满分跌至 11%,人格约束违规率超过对抗压力基线。
针对知识图谱问答(KGQA)中答案标签监督噪声大、LLM 精炼监督成本高的问题,研究者提出 Reward on Path(RoP)框架,用非对称目标从答案标签中学习轻量的、以问题为条件的路径奖励。
研究者提出 Von Neumann 神经元与 Von Neumann Networks(VNN),在细胞阵列上让神经元角色可被学习,网络架构仅取决于输入输出在阵列上的结构与位置。
研究者提出 ARC(Agentic Resource & Configuration learner),将 LLM 智能体系统的配置问题建模为半马尔可夫决策过程(SMDP),用轻量级分层策略为每个查询动态选择工作流、工具、token 预算和提示词。
研究者提出 Universe of Thoughts(UoT)框架,将组合式、探索式与转化式创造力形式化为可执行的计算算子,并设计三个低约束创造性推理任务。T-UoT 搭配 GPT-4o 在 Bridge 和 Electricity 任务上表现最强,C-UoT 在 Society 任务上相对表现最佳。
PuzzleJAX 是一个 GPU 加速的益智游戏引擎与描述语言,支持对树搜索、强化学习和 LLM 推理能力进行快速基准测试。它基于 PuzzleScript 风格的 DSL 动态编译任意游戏,已在其上验证了数百款 PuzzleScript 游戏,并分析了搜索、学习与语言模型在这些游戏上的表现。该工作发表于 IEEE Conference on Games 2026。
该论文提出一个框架,用于在固定候选解释集合中按策略进行选择,候选由不确定性变化、预测方向及相对决策边界的区间位置刻画,并结合资格规则、可选双向 Pareto 筛选与策略感知排序。
IdeaAnchor 提出一种用结构化规格作为特权信号训练 LLM 进行科研选题的范式,每个实例编码输入论文的功能角色、关系与目标综合标准。研究者从已发表论文中挖掘实例,通过示范、自蒸馏和强化学习训练模型,并在推理时用检索增强生成。实验显示选题质量持续提升,其中 anchor 训练强化创造性综合,检索改善细节展开,两者结合效果最佳。
WorldSonus 是一个面向世界模型的交互式视频转音频框架,可实时合成空间音效。它采用流式因果自回归扩散架构,实时因子低至 0.41,并通过以音频为中心的描述管线与分块提示词调度实现生成过程中的动态声音控制,同时利用立体声与 ambisonic 数据实现空间对齐。实验显示其在声学质量与空间对齐上匹配或超越当前最优的双向模型。
研究者提出 Calibrated Pruning 强化学习(RLCP),利用 critic 分数和在线阈值自适应调整保留动作集,并证明自适应轨迹上代理漏检率的确定性上界。在 KuaiRand-Pure 和 MovieLens 1M 上对比四种 RL 基线,19 种配置中至少一个 RLCP 变体取得最高目录多样性,达最强基线的 1.11× 至 5.21×,会话深度相当且保留集不更大。
研究首次系统分析投机解码的安全影响,发现各类有损投机解码方法在提升推理效率时,越狱与提示注入攻击成功率上升速度远快于效用下降,存在明显的安全-效用不对称。为此提出 SecureSD,理论分析指出安全退化主要源于 draft model 生成的早期 token,故对早期解码位置的 draft token 采用更严格验证标准。
研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。