RASS:面向扩散草稿树的秩感知投机采样
研究者提出秩感知投机采样(RASS),一种基于秩感知列表耦合的扩散草稿树验证规则,按提议-目标均值位移对草稿候选排序并采样秩权重,以最小化所选提议与目标分布的总变差。
研究者提出秩感知投机采样(RASS),一种基于秩感知列表耦合的扩散草稿树验证规则,按提议-目标均值位移对草稿候选排序并采样秩权重,以最小化所选提议与目标分布的总变差。
研究系统考察了深度序列模型在时间序列共形预测中的三种用法:条件分位数回归、条件分位数函数估计与局部化共形预测。作者给出理论分析,证明这三种方法在适当假设下均具备渐近条件覆盖率保证,并在真实数据集上验证了其有效性。
研究者用语音语言模型自身完整与部分波形的翻译结果构造 prefix 监督,无需转录文本或人工翻译,即可适配端到端同声传译。在 FLEURS 和 CoVoST2 三个翻译方向上,prefix 训练改善了质量—延迟前沿,置信度阈值提供了最稳定的操作区间;多轮 append-only 解码在低延迟下更强,其提交校准误差整体下降 63–68%,早期 prefix 下降 68–80%。
SpectralCache 是一种免训练谱缓存框架,利用扩散世界模型特征在相邻去噪步间奇异子空间高度稳定的特性,复用稳定子空间并通过线性外推估计低维奇异值,从而跳过部分主干网络计算。在 HunyuanWorld-Voyager-13B 上,它实现 5.22 倍加速,静态场景 WorldScore 保持 65.90,推理效率显著优于现有免训练缓存方法。
SatisDive 是一种免训练的推理时方法,通过批次相对奖励阈值区分高低奖励候选,在满足奖励下限的同时保证批次多样性。在 Pick-a-Pic 上,以 FLUX.1-dev 为基座模型、HPSv3 为奖励时,最差候选奖励较 FK steering 提升最高 0.43;以 SANA-1.6B 为基座、ImageReward 为奖励时提升最高 0.70。
研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。
DeReAct 是一种模块化智能体架构,将动作校验与完成判定外置为 Critic 和 Context Manager 两个门控策略。在 GAIA 和 SWE-bench Verified 上,Qwen3-Coder-480B 的 Pass@1 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分,模型越弱增益越明显。
针对大语言模型强化学习通常最大化期望回报、概率求和无法指出哪条解法真正有效的问题,研究者提出 Tropical Reinforcement Learning,用取最大值的热带半环替代概率相加,使状态价值对应最可能被验证解法的对数概率并附带可复用路径。
对四个开放权重类型化决策模型的研究发现,模型返回的概率主要取决于选项标签而非其定义,即存在"选项标签偏差"。删除全部定义后准确率几乎不变(laya-td:0.8559 对 0.8487),而将选项改名为 A、B 后准确率提升 +0.1511。
研究者提出 HXAI,一个在分布式能源系统中兼顾隐私与可解释性的分层框架,由本地模型在安全环境内生成细粒度解释、区域模型聚合解释以支持电网级分析两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟和真实能源数据集上实现了区域负载管理的有用洞察,同时家电级用电数据始终保留在本地、不传输给电网运营商。
研究将行为评估扩展到潜空间,在全部 11 个开放权重 LLM 中发现了专门的临床概念中心,这些中心可解释、仅对对齐的临床叙事激活,并在受限与开放式场景中因果驱动模型行为。在对抗性角色提示下模型仍保持内部一致并持续使用相关概念中心,而对齐提示可提升下游临床表现;沿这些中心进行引导也能带来下游改进。盲法临床医生验证显示,这些概念中心的激活与使用可预测临床医生的偏好。
针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。
多模态大模型能正确报告空间事实,却未必在后续推理中使用该事实。研究者提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 局部事实绑定到 L4 变换下状态判断四个层级,揭示"可用性—利用率"鸿沟:Qwen3.5-9B 在 100 条正确恢复初始状态的序列中有 50 条无法完成完整变换,显式提供状态可修复全部 50 条。
研究者提出 MACTS-EM 多智能体协作时间序列预测框架,通过领域专用预测智能体、元认知层动态分配、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件协同工作。在金融市场、气候模式、能源消耗和疫情传播等场景评测中,该框架预测准确率提升 8-12%,零样本迁移能力提升 22-27%,regime shifts 期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。
针对一致性模型(CM)多步采样中步数对样本质量影响难以解释的问题,研究者将多步 CM 采样建模为加噪与近似去噪算子的复合,在可验证的稳定性假设下推导出非渐近误差界,将初始化误差的收缩与近似误差的累积分离。该误差界表明:早期大噪声水平驱动收缩,后期小噪声水平控制残余偏差;对强对数凹与半对数凹目标还给出显式常数。实验显示误差界中的收缩与近似曲线可被可靠测量,并与预测的函数形式吻合。
研究对固定 YOLOv8s 行人检测器的后置解释在 PIE 与 JAAD 数据集上进行审计,发现基于删除的忠实度与解释时的检测强度强相关,D-RISE 的 Spearman 相关系数达 0.70 至 0.82,使朴素置信度分层比较不可靠。
研究者发布 SymCE,包含 4,707 道本科代数与实分析假猜想,每题配有可执行的逐定理 Python 验证器,验证器同时充当奖励函数。
研究团队提出 VLA 推理框架 IG-VLA,让模型在视觉表征空间中想象任务相关的未来场景演变,并通过 Scene Gist Memory 将推理结果内化为紧凑的 Scene Gist Token,从而在推理时跳过显式未来想象。
研究提出一种生成语法信息驱动的神经符号框架,结合生成句法理论与 AraBERT,将现代标准阿拉伯语 DP 的结构歧义建模为候选决策任务,通过候选条件化输入表示进行评估。
研究探索用 LLM 作为"不完美专家"完成解释结构建模(ISM)中的因果图发现,以替代传统依赖专家反复交互的方式。对比成对、k-wise、逐行和全图四种方法后,逐行法(SHD=160,F1-score=0.77)与全图法(SHD=135,F1-score=0.73)表现最佳。该集成 LLM-ISM 路径有望让 ISM 扩展到含数百个变量的研究。
研究提出一种结合代理模型与强化学习的控制框架,用于优化核物理实验中的动态极化靶。基于 APOLLO 低温靶系统运行数据,高斯过程回归模型能提供校准的不确定性估计并识别训练分布外区域,MLP 对分布偏移敏感性有限。采用下置信界奖励训练的强化学习智能体,将操作员操作效果提升近 2 倍。
研究在严格 1-bit 反馈约束下的固定置信度最佳臂识别问题,学习者每轮只能收到一个比特,判断采样奖励是否属于所选查询集。作者提出基于随机阈值查询与截断尾积分恒等式的时间一致 1-bit 均值估计原语,并嵌入候选-挑战者算法:固定截断版本给出 anytime (ε,δ)-PAC 保证,分阶段自适应截断版本实现间隙自适应样本复杂度。
研究者提出 Lexicographic Multi-Objective On-Policy Distillation(LMOPD),一种按显式优先级整合奖励专精策略的多教师方法,通过字典序路由与对数策略修正投影保护高优先级能力。
多智能体辩论中,向一致多数派妥协的 LLM 智能体其实并未改变"想法"。研究用 J-lens 从残差流中读取中间实体(bridge),在 Qwen3.5-4B。
研究者预训练了共享内存的 Looped Transformer(LPT),仅第一次递归写入 key-value cache,后续递归读取该缓存并保留自身短窗口,结果共享内存不但不损质量反而提升质量。
研究者提出 Hyperbolic Entropy Steering(HEST),将隐藏状态嵌入 Poincaré 球,用仅以模型自身 next-token 熵为标签的轻量探针,在熵超过阈值的 token 处沿测地线调整状态。
WakeKV 是一种响应式 KV 驻留策略,将"冷却"的注意力头状态移入可恢复的 CPU 存储池,而非冻结或永久驱逐。研究在 1.5B-8B 三个模型、三种场景下测得多数注意力头在生成过程中至少改变一次读取行为,WakeKV 在匹配内存或预算下持续优于冻结分类与破坏性驱逐,并在 Mistral-7B 的 FlexiCache/vLLM 实现上验证了吞吐提升且保持 LongBench 质量。
e-process-authorized Thompson sampling(e-ATS)为每个臂维护全历史和折扣 Beta 状态,由 anytime-valid e-process 先授权折扣状态、再用可逆相关性分数控制其影响,未获授权前完全遵循乐观 Thompson sampling(OTS)。
AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。
FUSEye 将冻结骨干的 COCO 预训练 YOLO26-x 转为鱼眼检测器,仅新增约 227k 参数,在 WoodScape 环视鱼眼基准上把 mAP50 从 0.148 提升至 0.266,并保留全量微调 84.3% 的精度。
一项研究在具身、网页导航和社交等五类环境中系统对比了微调与 RAG 两种基于 LM 的世界模型构建方式,发现微调在 20 个设置中的 15 个能让智能体获得更高奖励。RAG 方法数据效率更高,而微调则更受益于扩大经验采集规模。研究者还提出用反事实干预估计检索阶段错误率,并构建了参数化捕捉核心动态、结合检索记忆的混合世界模型系统。
研究对开源 Laya 与托管 Jev 两个 System-1 决策模型在 11 个智能体决策点上做了配对评测,覆盖 7,283 个基础用例和 6,640 个鲁棒性变体。
DAGS 是一种轻量、无注意力机制的解耦外观与几何条件方案,可引导冻结的图像 DiT 生成高保真、高一致且可独立控制的渲染结果。它用两个小型卷积编码器逐帧计算条件特征,并以逐层逐元素的残差注入图像 token,避免注意力堆叠条件的二次开销。
TRAC 是一个无需训练的自回归视频生成加速框架,通过鲁棒累积调度(RCS)、自回归轨迹感知引导调度(ATGS)和频谱结构校正(SSC)三个组件,解决分块去噪轨迹中近似误差累积传播的问题。在 SkyReels-V2 和 FramePack-F1 上的实验显示,TRAC 相比现有方法同时实现了最高的推理效率和最佳生成质量。
一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。
TypeSafe 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中回应 Jev 估值 100 亿美元,并称其日处理量已突破一万亿 token。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
前 DeepMind AlphaGo 核心成员 Thore Graepel 撰文指出,当前 LLM 的链式推理仍由同一套下一 token 预测过程生成,不构成真正独立的推理机制。
openJiuwen 团队开源智能路由框架 model-router,并首发 x-router 算法,在 Agent 与模型之间增加一层按任务复杂度动态选模的决策能力。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其 Recursive Language Models(RLM)等工作,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。