跳到正文
10月7日周三
  1. arXiv cs.LG26

    高斯过程因果模型离散结果的反事实概率推断

    研究提出统一概率框架,将 GP 预测器与显式外生噪声机制配对,为二元、名义和有序离散结果分别推导精确的条件噪声反演方法,并证明其能复现拟合模型的观测与干预分布。在合成 SCM 上,对有序数据误用分类耦合会使反事实误差膨胀约三倍,且该误差不随数据量增加而下降。

  2. arXiv cs.LG12

    VOCEM:用联合效应建模实现方差最优的离策略评估

    针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。

  3. arXiv cs.LG15

    基于游戏画面深度学习的多标签感知 Bug 检测

    研究提出 ResNet-BiLSTM 模型用于游戏画面多标签感知 Bug 检测,在基准数据集上取得 85.78% 的 F1 分数,优于 Inflated 3D ConvNet 和 3D ResNet 等视频分类模型。结果表明时序依赖建模有助于提升基于视频的 Bug 检测准确率。研究同时发布新数据集,包含 77,969 个视频片段、约 120 万帧,覆盖 5 类 Bug 在同一帧中的组合。

  4. arXiv cs.LG17

    奇异值分解的几何重发现:当证明变成算法

    一篇 31 页的 arXiv 文章以几何方式重新推导奇异值分解(SVD),主张其构造正是主成分分析、核方法与 PageRank 背后的机制。文章先由单位圆到椭圆的映射推出奇异值,再用该构造证明谱定理而非假设它,并说明最大化递归对应幂法与 PageRank、定位极大值的引理对应梯度下降的停止规则。

  5. arXiv cs.LG22

    Bregman 散度如何塑造 Shampoo 优化器

    研究提出统一 Bregman 散度框架,将 Shampoo 优化器中 Frobenius、KL 等散度选择纳入同一视角联合分析。通过梯度二阶矩的谱分析发现,部分散度能更好补偿有限样本下二阶矩的低估,解释了不同 Shampoo 变体的行为差异,并在 GPT-2 预训练实验中验证。

  6. arXiv cs.LG18

    STEP-KD:面向早期芯片时序预测的序贯知识蒸馏

    针对早期阶段数据预测布线后时序的难题,研究者提出 STEP-KD,利用布线后、布局后、floorplan 后各阶段教师模型,通过表征对齐将知识序贯蒸馏到综合后学生模型。实验显示其将 Total Negative Slack 预测的加权平均绝对百分比误差降至 19.78%,而业界标准 STA 工具为 74.84%。

  7. arXiv cs.LG17

    面向可靠选择性预测的结构感知图弃权方法

    研究提出结构感知图弃权方法,将实例级可信度与变量间关系一致性视为两条独立可靠性轴,通过可学习稀疏图和 Dirichlet 式结构能量 E_struct 实现后者,并用误差加权图正则化与分数-误差对齐训练。在七个长时程基准和四个骨干模型上,结构门控在相同覆盖率下常比 TEM 降低选择性 MSE,跨变量结构信息更丰富时增益最大,但增益并非普遍存在。

  8. arXiv cs.LG22

    OxiGen:氧化态感知的晶体扩散生成模型

    OxiGen 是一种氧化态感知的晶体扩散模型,在生成过程中显式表示氧化态,并通过有限状态自动机精确推理的结构化输出层强制满足全局电荷中性。实验显示,OxiGen 大幅提升了氧化态保真度,在评估方法中生成稳定、唯一且新颖晶体的比例最高,即便在性质条件下也保持高组成有效性。

  9. arXiv cs.LG22

    LDTool 与 HLDTool:从表格数据中可扩展提取并可视化多属性逻辑依赖与函数依赖

    罗斯托克大学等机构提出 LDTool 和 HLDTool,用于从表格数据中提取并可视化多属性逻辑依赖(LD)与函数依赖(FD)。LDTool 将依赖发现扩展到成对关系之外,HLDTool 通过超图引导的搜索空间缩减实现可扩展提取。在 3 个模拟和 11 个真实数据集上,LDTool 在高维特征空间中以更低运行时间复现了现有 FD 发现方法的相同结果,HLDTool 则支持数百个特征的依赖发现。

  10. arXiv cs.LG23

    选择性标签下的表演性预测:NeurIPS 2026 论文提出鲁棒优化方法

    针对表演性预测中仅能观测到被接受子集标签的"选择性标签"问题,研究者形式化定义了该场景,并证明仅用观测数据重训练会误导过程、破坏收敛保证。他们提出基于正标签概率置信区间的最坏情况目标,对其实施重复风险最小化(RRM)可将结果保持在真实稳定点的有界距离内。在带公平正则化的借贷实验中,该鲁棒优化方法性能接近拥有完整标签访问权的 RRM。

  11. arXiv cs.LG18

    线性函数逼近下基于分段奖励反馈的强化学习

    研究在线性函数逼近下用分段奖励反馈替代逐状态-动作奖励的强化学习。针对等长分段,作者提出 $\bitssegd$、$\edlinucbsegd$ 及统一 $\seglsvits$ 框架,并给出近匹配下界;二元反馈下增加分段数可指数级降低 regret,而求和反馈下分段粒度影响不大。允许任意分段的 $\uneqsegbitsd$ 表明等长分段性能最佳。

  12. arXiv cs.LG26

    研究揭示基于潜空间的水印方法固有鲁棒性局限

    针对扩散模型的潜空间水印方法,一项理论分析首次解释了这类方法为何对旋转、缩放、平移等图像扰动缺乏不变性,并推导出刻画像素空间扰动与潜空间响应关系的最大扰动界。研究还首次给出覆盖实际检测机制各组件的解析形式,实验验证了理论结论:在当前设计范式下,基于潜空间的水印方法固有地表现出有限鲁棒性。

  13. arXiv cs.LG20

    Mu-DisCoCat:面向量子处理器组合泛化的变分流水线

    研究者提出 Mu-DisCoCat,一个面向 DisCoCat 的多模态变分量子学习框架,用于实现组合概念泛化(CoCoGen)。该框架先从单物体图文对学习稳定的物体表示,再固定这些表示学习多物体场景中的关系;经典模拟中使用 Uhlmann 态保真度计算多模态电路表示的重叠,关系 OOD 准确率高于所评估的 CLIP 基线。

  14. arXiv cs.LG12

    优化编码器:重新思考神经场的二阶元学习

    研究者提出"优化编码器"视角,将神经场中的隐变量优化统一为编码过程,并据此推出基于等变 Transformer 的神经场模型 MetaLF。MetaLF 通过自注意力对隐变量点云进行上下文化,在图像与 3D 形状重建中仅需 3 到 5 次梯度更新即可提升保真度,并支持图像、形状与体数据的语义预测。

  15. arXiv cs.LG22

    面向 LoRA 的黎曼几何:一种新的预条件度量

    研究者提出一种专为 LoRA 定制的新黎曼度量,利用 $(B, A) \sim (BG^{-1}, AG^\top)$ 等价关系诱导的商流形,在每次梯度步引入预条件。理论上证明该预条件使 LoRA 的权重更新方向最接近全量微调的梯度方向,且更新后权重矩阵在 Frobenius 范数上比常规预条件和无预条件更接近全量微调。语言与视觉领域的微调实验验证了其有效性与效率。

  16. arXiv cs.LG22

    SepsisLens:面向可分解早期脓毒症预警的结构保持序列建模

    SepsisLens 通过保留变量索引的时间状态实现可分解的早期脓毒症预警,在风险合成前不压缩变量维度。该模型在三个公开 ICU 队列和一个私立医院队列上均取得强判别性能,并在 MIMIC-IV 上于相同事件召回率下降低告警负担。结构消融支持其设计,输入侧掩码显示排序分量反映了对预测影响更大的变量。

  17. arXiv cs.LG22

    分子编码器能否在没有实验读数的情况下预测表型活性?

    研究评估了 CLOOME、CellCLIP 等基于分子-形态配对数据对比预训练的分子编码器能否作为表型预测的廉价替代方案。在控制预训练边界泄漏和表型活性与细胞毒性相关性两个混杂因素后,六种表征(含匹配 CLOOME 输入与层数的非预训练 MLP 对照)在两个 Cell Painting 筛选中均显示,预训练分子编码器相较普通理化描述符无明显优势,且毒性通常比表型活性更易预测。

  18. arXiv cs.LG22

    模型合并再审视:重新思考任务算术带来的隐式正则化

    研究发现,模型合并中通过额外数据集搜索任务权重更新线性组合系数的标准做法,会引入一种隐式正则化,将候选模型限制在任务权重更新张成的子空间内。实验表明,去掉这一正则化直接优化合并模型权重,可在多种架构和领域显著提升常见合并方法的表现,甚至在每类仅一个样本的极端数据受限场景下依然有效;直接优化预训练模型权重也能超越部分现有合并方法。

  19. arXiv cs.LG22

    高阶模型赢在高阶原因吗?重新审视超图学习的性能增益

    研究提出受控的性能归因框架,在保持低阶(成对)信息不变的前提下扰动高阶信息,覆盖三类任务的 25 个常用超图学习基准。结果显示,高阶模型(如超图神经网络)原本优于低阶基线,但在扰动后仍保留大部分优势,说明这部分增益无需高阶信息即可获得。更丰富的成对加权、更多成对特征传播步数和归一化等简单改进可缩小剩余差距,作者呼吁区分性能增益与其解释并采用更强的低阶基线。

  20. arXiv cs.LG12

    在 Log-Concave 随机效用模型中从人类反馈学习排序

    研究在 log-concave 噪声的随机效用模型下,从人类比较反馈中恢复物品排序所需的样本量。反馈分完整排序与仅揭示第一名两种类型,作者为二者建立了最坏情况样本复杂度下界,并提出匹配至对数因子的算法,且无需知道噪声分布、仅需方差上界。结果表明仅知胜者反馈的排序问题本质上更难,其样本复杂度取决于物品集合中的最小获胜概率。

  21. arXiv cs.LG22

    重新审视深度强化学习中的时间正则化:CATS 实现平滑控制

    研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。