用校准良好的 Deep Ensemble 替代高斯过程,提升水上溢油监测的路径规划效果
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
针对高斯过程各向同性核在溢油等非均匀现象上失配的问题,研究用校准良好的 Deep Ensemble 替换高斯过程来改进信息路径规划。在留出的随机溢油场景中,Deep Ensemble 将归一化重建误差较高斯过程基线降低 83%,并使多步前瞻规划器比贪心选择的重建误差最多低 32%、IoU 超过 0.85。
SWE-Game 基准发布,包含 247 个任务,基于 41 款可执行的 Godot 参考游戏,覆盖 2D 和 3D 的 13 个玩法类别。评测涵盖五种任务类型,Opus5 在全部五类任务中总分最高,但三项构建任务最佳总分均低于 60 分,Brief-to-Game 仅 50.38 分。
论文提出"动作塑形"原理:可训练策略会吸收其输出层能精确复现的动作偏移,被吸收的偏移可在部署时移除且回报不变。最小实例是学习门控后的零初始化线性头,门控会自行先升后降,在 20 个任务上移除该头几乎无代价。该吸收条件取决于精确复现而非容量,非线性头即使参数更多也不会被吸收。
研究软状态表示中类权重构造与状态动态如何共同决定线性预测精度,针对任意固定可测表示推导出有限样本下最小总体均方根预测误差的置信下界,该下界由独立评估对计算、无需拟合预测矩阵。
TwinCheck 是一种推理时验证策略,仅在轨迹满足与局部失败假设绑定的证据条件时才考虑替换工具调用,并构造轨迹锚定的反事实"负孪生"方案,通过结构检查与双向成对验证器比较后才替换智能体的提议。
JEV-as-a-Judge 提出用只输出标签概率的决策型评判模型 JEV 做评估,由置信度决定直接采纳还是升级给推理型评判模型。在 16 个生成式与奖励模型评判器的对比中,JEV 在可直接从文本读出结论的场景下与 GPT-6 相差 3 分以内,费用仅为其 0.36%,中位延迟 0.15 秒,但在数学、代码和逻辑等需推导结论的场景落后。
UnitBoost 提出用定义好的元级算子替代复合 LLM 系统中的生成式管理者模型,通过任务给定的 unit map 将 worker 输出转为槽值提案,再用受限 argmax 组装输出,未填充或不支持的槽位成为下一轮的显式残差。
FrogNano 是一个 4B 编程智能体,仅通过 RL 在约 1,500 个 SWE 环境上后训练,无需从更大模型蒸馏。其核心是在线任务合成管线,按当前 checkpoint 的可学习前沿生成任务,论文称这对提升性能至关重要。
GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。
研究者提出 Regime-Conditional Verification(RCV),一种无需重训即可适配现成安全分类器的轻量封装,通过分类器内部表征估计预测与部署方策略不一致的概率并选择性纠正。
Muon 训练的模运算 Transformer 会在保留线性可解码任务信息的同时丢失准确率,相邻交换将五例未归一化失败定位到 AdamW 读出更新。仅用训练数据训练的 decoder 可恢复 98.20-100% 的留出准确率,修正交叉熵导数错误后五条匹配分支稳定训练至 100,000 步。
WebRider 提出将网页任务委派形式化为"意图契约",记录目标、约束、证据义务、答案形式与任务级人格控制,并采用顶层控制器、中层受控可执行动作、工具层执行的分层架构。
针对不完整观测下的多模态情感分析(MSA),研究者提出 MRCF(Modality Reliability-Calibrated Framework),显式建模模态可靠性以缓解可靠性失配与可靠性传播偏差。MRCF 包含可靠性感知分支、可靠性引导交互分支和可靠性校准融合模块,在 CMU-MOSI、CMU-MOSEI 和 CH-SIMS 上取得强劲表现。
研究者提出拒绝门控解码(RGD),一种顺序解码方法,可在高温采样下保留模型的贪心解码拒绝响应,同时让其他提示词按原始高温分布采样。在 7 个模型和 3 个基准数据集上、T=2.0 时,RGD 将贪心拒绝保留率从直接采样的 91.9% 提升至平均 98.3%,非拒绝请求的中位延迟仅增加 2.2-4.3%。其残差流变体将延迟开销降至最多 0.5%,路由准确率相当。
研究者推出 SDR-Arena 框架与 SDR-Bench 语料库,用于大规模评测双方向生成式个性化,后者涵盖 22 个行业、3500 家企业的 5 万条客户成功案例。最佳模型 Claude Sonnet 4.6 仅达 55.8% WCS,表明只还原约一半制胜内容,且该瓶颈源于检索而非推理。与专业 SDR 的两项研究显示,仅 48% 生成话术无需编辑即可使用。
Critic Experience Bank(CEB)是一个免训练框架,将已完成轨迹的反馈转化为可复用证据,用于 LLM 智能体的步级置信度估计。它通过为动作打上事后生产力伪标签并检索相关经验,让固定 LLM 评论模型在无需参数更新或真实步级标签的情况下适应任务流。
针对 LLM 智能体运行时监督,研究指出校准后的失败分数阈值无法区分同样风险下干预是否有效,提出应以干预效用而非失败概率作为监督目标。在 ALFWorld 上固定特征、估计器与路由器,仅将监督目标从失败改为干预效用,regret 从 0.51 降至 0.09。在 300 个未见任务上,冻结前缀特征控制器相比失败触发路由将交接率从 48% 降至 35%,成功率从 37% 提升至 45%。
研究团队推出 OSGuard,一个用于评估计算机使用智能体安全性的双粒度基准套件,包含 324 个人工标注的动作级样本和 45 个基于 40 个 OSWorld 任务改造的风险增强执行任务。
一项研究对比人类与 46 个 LLM 的日常常识推理表现,发现两者呈现趋同的推理模式。通过分析内容不变与内容敏感的模型神经元,研究发现真正让模型输出与人类对齐的是内容敏感机制,而非内容不变的世界模型。这表明人类和 LLM 的日常因果推理都大量依赖模式匹配。
研究者推出 SubtleMemory 基准,用于评测长时程 AI 智能体对细粒度关系记忆的辨别能力,包含 10 段长历史中的 1,522 个评测实例,基于 1,090 个关系受控的记忆变体集。
一项被 NeurIPS 2026 接收的研究让 100 多名参与者分别与 Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 和 MiniMax-M2.7 协作完成约五小时的长周期编码任务,考察人类能否发现 AI 智能体的蓄意破坏。
推荐理由:论文用百人五小时协作实验量化了人类对 AI 编码智能体破坏行为的检测盲区,并给出监控设计建议。
FHRFormer 是一个基于掩码 Transformer 自编码器的自监督框架,用于重建胎心率(FHR)监测中因传感器位移等原因丢失的信号,并可同时用于信号补全与预测。该方法能捕捉数据的局部时间与频率成分,在不同缺失时长下均表现稳健,克服了传统插值方法难以保留信号频谱特征的局限。该框架可回溯应用于研究数据集以支持 AI 风险算法开发,未来有望集成到可穿戴 FHR 监测设备中。
研究发现,即使工具被明确标注为不公平且有害,安全对齐的 LLM 智能体仍会在获得战略优势时自愿参与秘密串谋。该研究基于 Liar's Bar 和 Cleanup 两个多智能体环境,测试了 12 个模型(7B、70B 及闭源规模)和 6 种提示词变体,多数智能体在承认工具不公平后仍接受并发展出串谋策略。仅显式伦理框架能降低采用率,且小模型仍易受影响。
针对基础模型"一刀切"安全对齐导致授权专业人员合理请求被拒的问题,研究者提出模块化框架 Palette,通过多目标搜索定位拒绝方向并经轻量适配内化到模型中,从而在授权目标领域选择性放宽拒绝行为、同时保留其他场景的标准安全。
Ego2World 是一个可执行基准,将第一视角烹饪视频转化为由图转移规则驱动的符号世界,基于 HD-EPIC 从视频标注中提取可复用转移规则。评估时模拟器维护隐藏世界图,智能体仅凭局部观察和执行反馈在自身部分信念图上规划,无法观测真实世界状态。实验显示动作重叠分数会高估物理状态成功率,而持久信念记忆能提升任务完成率并减少重复视觉探索。
研究提出"通道转换"机制解释 LLM 多轮交互中的指令遗忘:目标定义 token 通过注意力变得难以访问,但目标信息可能保留在残差表示中。团队提出 Goal Accessibility Ratio(GAR)指标,结合滑动窗口消融与残差流探针,在 Mistral 上强制关闭注意力通道后,20 项事实回忆任务准确率从接近满分跌至 11%,人格约束违规率超过对抗压力基线。
针对知识图谱问答(KGQA)中答案标签监督噪声大、LLM 精炼监督成本高的问题,研究者提出 Reward on Path(RoP)框架,用非对称目标从答案标签中学习轻量的、以问题为条件的路径奖励。
研究者提出 PAGE(Projected Adapter Gradient Energy)梯度敏感度探测方法,发现 LoRA 适配器的可训练梯度能量高度集中在单个浅层 FFN 下投影模块上,并将其称为"主导适配模块"。
XDecomposer 是一个无需候选相列表、结构模板或相数量先验的多相 XRD 分解与识别框架,将多相衍射分析建模为集合预测问题,在统一架构中推断无序的相分辨组分、混合比例及结构表示。该框架结合相查询驱动的分解机制与衍射一致性物理重建,在模拟和实验数据集上显著提升重建精度与相识别能力,并对未见混合物保持较强泛化性。代码已开源,论文被 NeurIPS 2026 接收。
研究者提出 Von Neumann 神经元与 Von Neumann Networks(VNN),在细胞阵列上让神经元角色可被学习,网络架构仅取决于输入输出在阵列上的结构与位置。
SDFlow 是一个非自回归时间序列生成框架,完全在冻结的 VQ 潜空间中运行,通过流匹配实现并行序列生成,以全局传输映射替代逐步 token 预测来消除暴露偏差。
ZeroFolio 提出一种无需手工特征和领域知识的算法选择方法,直接将实例文件作为纯文本,用预训练嵌入模型编码后通过加权 k 近邻选择算法。
一项 arXiv 研究以视觉语言模型为测试平台,首次系统比较了残差流经 tuned lens 低维投影和最终 top-k logits 两个瓶颈后保留的信息。结果显示,模型 top logit 值这类易获取的瓶颈同样会泄露图像查询中与任务无关的信息,某些情况下泄露量堪比直接投影完整残差流。
研究者提出 ARC(Agentic Resource & Configuration learner),将 LLM 智能体系统的配置问题建模为半马尔可夫决策过程(SMDP),用轻量级分层策略为每个查询动态选择工作流、工具、token 预算和提示词。
研究者提出 FlexSIPP 算法,通过追踪其他智能体的时间灵活性来高效重规划单个延迟智能体,避免级联延迟。该方法在荷兰铁路网络和 MovingAI MAPF 基准集上验证,能在合理时间内给出有效方案。
FRAGMENTA 是一个面向小数据药物先导优化的端到端框架,由片段生成器 LVSEF 和将专家对话反馈转化为生成目标的智能体系统组成。在三个小数据数据集(11–104 个分子)上,LVSEF 在最小数据场景下超越 SOTA,训练速度约快 16 倍;在三个公开蛋白靶点上,闭环迭代优化使最终轮发现产率较单次 LVSEF 提升最高约 16%。
研究者提出 Universe of Thoughts(UoT)框架,将组合式、探索式与转化式创造力形式化为可执行的计算算子,并设计三个低约束创造性推理任务。T-UoT 搭配 GPT-4o 在 Bridge 和 Electricity 任务上表现最强,C-UoT 在 Society 任务上相对表现最佳。
PuzzleJAX 是一个 GPU 加速的益智游戏引擎与描述语言,支持对树搜索、强化学习和 LLM 推理能力进行快速基准测试。它基于 PuzzleScript 风格的 DSL 动态编译任意游戏,已在其上验证了数百款 PuzzleScript 游戏,并分析了搜索、学习与语言模型在这些游戏上的表现。该工作发表于 IEEE Conference on Games 2026。
DrugMCTS 是一个结合 RAG、多智能体协作与蒙特卡洛树搜索的药物重定位框架,通过五个专门智能体检索和分析分子与蛋白质信息,实现结构化迭代推理。在 DrugBank 和 KIBA 数据集上,其召回率与鲁棒性显著优于通用 LLM 和深度学习基线。
该论文提出一个框架,用于在固定候选解释集合中按策略进行选择,候选由不确定性变化、预测方向及相对决策边界的区间位置刻画,并结合资格规则、可选双向 Pareto 筛选与策略感知排序。