NN-linkage:算法对齐的神经凝聚层次聚类树构建方法
研究者提出 NN-linkage,一种与 Lance-Williams(LW)递推算法对齐的神经网络模型,可学习任务特定的局部依赖合并规则,同时保留经典 linkage 算法的递归结构与高效推理。
研究者提出 NN-linkage,一种与 Lance-Williams(LW)递推算法对齐的神经网络模型,可学习任务特定的局部依赖合并规则,同时保留经典 linkage 算法的递归结构与高效推理。
研究者提出基于 Chambolle-Pock 原始-对偶混合梯度(PDHG)方法的消息传递框架 GraphPDHG,用于求解一般图鞍点问题。理论上该网络能通过模拟 PDHG 高效求解一类图鞍点问题,并可学习加速版 PDHG 算法;实验表明其作为二阶优化方法 SSNAL 的学习式热启动表现良好,且与 PDHG 对齐后比未对齐的 GNN 基线具有更强的规模泛化能力。
神经场通常以重建效果评估,但研究显示这忽略了两个有用属性:网络适应新观测的难易程度,以及权重从早期观测中保留的信息。图像实验中,简单局部线性模型能准确预测适应成本,替换切线核会显著恶化预测;物理场实验中,两个波历史终止于同一观测时,最终权重以 68.6% 准确率恢复波速符号,而仅凭当前观测只有 50%。切线核特征值可同时预测哪些变化易学以及被后续拟合覆盖的速度。
研究者提出 BiToK-SD,一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中自适应学习哪些 token 位置最值得蒸馏。该方法将 Top-K token 选择建模为可微的阈值松弛作为下层问题,上层问题则对选中位置执行知识蒸馏,使选择随学生策略演化而调整。在数学推理基准上,BiToK-SD 在全部对比方法中取得最佳平均性能,且仅需轻量额外计算。
研究对 4 个从零训练的模型和 4 个时间序列基础模型(TSFM)在 3 个真实负荷预测数据集上进行了基准测试,考察未来协变量信息可用性与质量不同的运行场景。结果显示 Chronos-2 在协变量可用或预测准确时,零样本和微调设置下均持续达到 SOTA,但随着协变量预测噪声增大性能下降,而 TimesNet 在严重协变量不确定性下表现更稳健。
研究者提出常曲率切片 Gromov-Wasserstein(CCSGW),一种用于对齐异构常曲率空间上概率分布的散度。该方法首次补全了球面空间基于测地线的一维投影,并将切片 GW 扩展到常曲率空间,在保留内在几何关系的同时避免高计算成本。将其接入图异常检测、图节点分类和多模态学习等混合曲率任务后,各类设置下均取得稳定性能提升。
研究首次为 RLVR 训练给出差分隐私保证:以单个提示词的全部回复为隐私记录,聚合梯度后只裁剪一次并加高斯噪声,隐私预算与每个提示词的回复数量和裁剪范数无关。
研究测试了用 LLM 从新闻中提取移民推拉信号、并通过特征级正则化惩罚融入加权 Lasso 预测框架的效果。在 2021 年 11 月至 2022 年 11 月的墨西哥—美国、乌克兰—波兰、叙利亚—土耳其等走廊上,各配置表现不一,没有单一正则化方法全面胜出。
研究者提出 Quantized Sufficient Statistics(QSS),将冻结的全局 schema 与可变、可求和分解的内容分离,使删除内容成为精确减法而非优化。
研究者构建了 ResearchTrails 数据集,从 Git 仓库的 commit 历史中提取结构化的人类研究轨迹,作为科学探索过程的代理,捕捉方法、实验与消融的连续变化。该数据集包含论文最终结果之外的中间研究决策信号,可用于在测试时检索人类研究经验作为外部技能,以及训练模型以提升对新研究决策的泛化能力。
研究者提出 WRAP(Wasserstein-Reweighting Adversarial Perturbation),一种面向非平稳市场的漂移感知对抗训练框架,用于深度对冲。
研究固定类原型下双曲多分类中 Riemannian 梯度流的隐式偏差,框架覆盖交叉熵等一般 PERM 损失。证明径向二分性:漂移系数 μ 为正时半径趋于理想边界且 r(t)=½log t+O(1),持续为负则有限时间内回到大半径阈值;边界方向收敛到 Busemann 风险的临界点,为边界饱和与近边界聚类提供渐近解释。该工作已被 NeurIPS 2026 接收为 Spotlight。
SoloQ 是一种无需校准数据的扩散语言模型量化框架,通过将权重和激活映射到归一化旋转基,实现数据无关的量化。在 LLaDA、Dream、Fast-LLM v2 和 Nemotron-Labs-Diffusion 上,SoloQ 在 4-bit 量化下保持精度并超越基于校准的基线;采用 NVFP4 时峰值内存降低最多 2.61 倍,端到端推理加速最多 2.24 倍。
一项基于 Panama 负荷数据集的研究发现,注意力模型预测峰值的时刻中位误差为 0 h、精确匹配率 51.6%,而注意力描述符 Ψ_out 的 argmax 中位误差达 5 h、精确匹配率为 0%,31 个窗口中有 27 个预测峰值更接近观测峰值。
针对测定异质性会削弱元学习效果的问题,研究者提出 MetaHeta 框架,通过以相关测定的辅助数据为条件进行预测,并用线性注意力处理大规模辅助数据、精确注意力处理稀缺任务上下文。在 ChEMBL 和 BindingDB 的测定数据上,该方法提升了小样本生物活性预测及回顾性贝叶斯优化中的化合物优先级排序表现。
研究提出一种诊断框架,将缓存预测视为时间异质监督,区分样本存储时已知的类别与之后学到的类别,并在任务级偏移前后评估模型。在 CIFAR-100 上使用 DER++,固定常数可在 1 个百分点等价范围内替代后学类别的未刷新存储分数,偏移将删除其匹配的代价从 14.9 降至 1.8 个百分点;而重分配存储时已知类别的非金标分数代价为 4.3 和 4.0 个百分点,图像蒸馏中同样存在。
一项基于 Vision Transformer 双路径时空注意力架构的研究显示,欧洲次季节土壤湿度预测的精度取决于问题构建方式:残差学习是超越持续性预测的关键,且仅在以物理单位预测根区土壤湿度时才有效。
研究者提出 Sculpt,一种嵌套势框架,将几何相关的耦合约束直接内置于参数化中,通过三维交错网格上体积矢量势的离散旋度生成无散度速度更新,并用共享标量势约束边界值以同时满足不可穿透性,无需逐步压力投影。该方法还引入覆盖多种城市形态与入流条件的 LES 数据集 UrbanWindFlow,用于同时评估精度与运动学可行性。
研究者提出 Contrastive Diffusion Alignment(ConDA),在冻结的预训练扩散模型潜变量之上仅学习一个轻量对齐映射,即可获得可识别的坐标表示。在 TCL/GCL 假设下,该方法能将潜在动力学状态识别到排列和逐分量可逆变换的程度,并保留潜在动态结构因果模型。在物理与机器人视频系统上,TCL 和 GCL 变体实现了近乎完美的分块状态恢复,并在模拟落体系统中实现精确恢复。
Stock-JEPA 提出一种联合嵌入预测框架,以低复杂度金融模型生成的多周期收益与风险统计作为先验锚点,再通过上下文条件修正预测器估计未来表征相对锚点的可预测位移。理论上最优修正可将先验锚点的期望平方误差降低 E[‖Δ‖₂²]。实验显示其在中国和美国股票市场上以 5 项关键指标超越 13 个强基线。
研究提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器每个 block 中 Self-Attention 和 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合作为编码器输出,以在保持训练稳定的同时学习更抽象的表征。
研究将路面修复计划形式化为 Repair Lot Skyline 问题,即定义在里程而非时间上的加权约束满足问题(WCSP),仅需单期病害调查。
研究者提出一种面向知识追踪(KT)的信息论评测框架,用 Context Tree Weighting(CTW)在题目作答历史上构建因果不确定性坐标,将预测投影到该坐标上,按不同熵区间评估模型增益,而非只看全局指标。
福特汽车提出一种面向高维时序数据的多元监测框架,用于 End-of-Line 测试数据的无监督异常检测,采用两阶段流程:先清洗并对齐时间序列,再做非线性降维与基于控制图的 Phase I 监测。在福特真实生产数据上,该方法的准确率、召回率和 F1 分别从原有模型的 0.50、0.30、0.429 提升至 0.625、1.00、0.769。框架支持无监督与有监督两种设置,模块化结构便于适配不同领域。
这篇博士论文系统研究了知识图谱嵌入(KGE)中的三类不确定性:来自不完整、噪声或概率输入的知识不确定性,训练随机性引发的算法不确定性,以及模型输出的预测不确定性。针对算法不确定性,论文提出基于投票的聚合框架;针对预测不确定性,将 conformal prediction 适配到 KGE,构建具有无分布覆盖保证的答案集;针对知识不确定性,提出统计有效的预测区间及基于嵌入向量的概率推理近似方法。
EVFormer 是一个融合当前 RGB 帧与之前 200 ms 双侧手腕 sEMG 的多模态框架,用于估计 44 个手指与手腕关节角度,通过顺序双向交叉注意力和特征级门控融合实现跨模态信息交互。
研究者提出一套评估框架,通过演化邻近初始状态的集合、与直接数值模拟对比,从误差形成、集合几何和极端事件三方面检验神经 PDE 求解器的动力学保真度。在二维 Kolmogorov 流上的实验显示,更小的轨迹误差可能来自更弱的误差放大而非更准确的局部更新,模型还能匹配集合整体散布与有效维度却漏掉邻近状态发散的空间方向。结果表明预测精度提升并不必然意味着动力学更忠实。
研究者提出知识蒸馏框架 MemKD,通过专门的损失函数捕捉教师与学生模型在时间序列子序列上的记忆保留差异,让紧凑循环神经网络更有效地模仿教师行为。实验显示 MemKD 显著优于现有 SOTA 知识蒸馏方法,并能在多种压缩比例下匹配教师模型性能,大幅减少参数量和内存占用而精度损失不显著。
QiYao-I 是一个面向不规则多变量时间序列预测的流形基础模型,通过采样条件化时间流形注意力机制将真实时间戳映射到可学习的时间流形特征空间,并向注意力层注入时间流形偏置,以捕捉不规则时间间隔与局部采样结构。
研究团队提出 Robust Async-Fed-Q,一种基于 epoch 的联邦强化学习算法,在智能体端对 Bellman 最优算子做方差缩减估计、在服务器端做鲁棒聚合,使部分智能体发送任意损坏信息时仍能保留协作的样本效率收益。
亚马逊与汽车制造业合作运行的事件驱动云基础设施,三年来调度 40000+ 次生产训练任务,训练物理预测模型与强化学习控制策略的专用模型对,相比常开 GPU 基础设施降低 72-78% 成本。
研究者提出 Guidance-Augmented GRPO(GA-GRPO)统一理论框架,将外部引导建模为改写问题分布的随机引导算子 G,并把策略梯度估计量分析为偏差受引导散度 delta_G 约束的 on-policy 估计量,可涵盖 GRPO、LUFFY、ExPO、PAPO、TAPO 等特例。
TEMPEST 是一种用 ArcFace 角度间隔损失训练的时间卷积网络嵌入模型,将 60 秒多模态驾驶窗口映射为 96 维嵌入,支持无需重训练的动态注册。在 45 名驾驶员的时序评测中,它取得 91.71% Rank-1 准确率,比最强 triplet-loss 基线高 58.4 个百分点;驾驶员池从 10 增至 45 时性能仅下降 4.3 个百分点。
研究者提出考虑集电路(CC),一种由多项 logit(MNL)单元构成的有向无环图定义的多阶段选择模型。在三选项折中任务上,CC 展现出显著的深度-范数分离:深度从 2 增至 3,达到误差 ε 所需的最优最大偏好向量范数从 Θ(log(1/ε)/ε) 降至 Θ(log(1/ε))。实验中,参数少于 600 的树状电路在四个固定池基准和 Expedia 时间划分上取得最低平均测试 NLL。
研究者提出 Grand Canonical Generators(GCG),将 Boltzmann 生成器扩展到巨正则系综,并给出两种设计:一种以化学势为条件联合采样粒子数与构型,另一种将巨正则分布分解为粒子数分布与对应正则 Boltzmann 密度。
研究针对掩码扩散模型 tau-leaping 采样中因并行去噪引入的分解误差 ε_fact,建立了将其与调度方案及目标依赖结构分离的精确积分表示,并给出最优调度的递归平稳方程。分析显示:当依赖密度 ρ 随维度 N 增大一致收敛到严格正连续分布时,调度优化只能改善 ε_fact 的首阶常数;若 ρ 退化,则可改善渐近阶。
论文刻画了固定设计下固定规模体积采样配合无权最小二乘何时达到其系数协方差上界:对无共线列的白化设计,接触空间在每个严格内点样本量下保持不变,其非零值构成有限正交族。研究给出全样本量的留一协方差亏缺比较、查询风险上下界及精确构造,并证明同一残差可精确达到整个查询当且仅当查询范围落在某一类空间内。
一项审计发现,GNN 在常用时空预测基准上的表现并不一致,重新评估时间线性基线后,GNN 在多个基准上的增益大幅缩水,在部分基准上甚至被线性基线超越。为 GNN 提供自回归残差可提升其表现,尤其在非交通类基准上;合成实验显示 GNN 对时间动态与空间图交互的异质性较为敏感。
QUASAR 是一种量化感知训练(QAT)方法,通过将轻量级损失感知重建引入训练循环,在每步训练中搜索少量 clipping 范围并用显著性加权最小二乘拟合反量化参数,从而收紧 QAT 的收敛与最终损失界。
研究者提出 proper scoring ensemble filter(PSEF),一种仅用合成轨迹训练的集成数据同化方法,其分析步为置换等变的 transformer 映射,训练采用严格适当评分规则(实现中用 energy score)。