跳到正文
今天10月7日周三547 条
  1. arXiv cs.LG22

    Bregman 散度如何塑造 Shampoo 优化器

    研究提出统一 Bregman 散度框架,将 Shampoo 优化器中 Frobenius、KL 等散度选择纳入同一视角联合分析。通过梯度二阶矩的谱分析发现,部分散度能更好补偿有限样本下二阶矩的低估,解释了不同 Shampoo 变体的行为差异,并在 GPT-2 预训练实验中验证。

  2. arXiv cs.LG18

    STEP-KD:面向早期芯片时序预测的序贯知识蒸馏

    针对早期阶段数据预测布线后时序的难题,研究者提出 STEP-KD,利用布线后、布局后、floorplan 后各阶段教师模型,通过表征对齐将知识序贯蒸馏到综合后学生模型。实验显示其将 Total Negative Slack 预测的加权平均绝对百分比误差降至 19.78%,而业界标准 STA 工具为 74.84%。

  3. arXiv cs.LG22

    OxiGen:氧化态感知的晶体扩散生成模型

    OxiGen 是一种氧化态感知的晶体扩散模型,在生成过程中显式表示氧化态,并通过有限状态自动机精确推理的结构化输出层强制满足全局电荷中性。实验显示,OxiGen 大幅提升了氧化态保真度,在评估方法中生成稳定、唯一且新颖晶体的比例最高,即便在性质条件下也保持高组成有效性。

  4. arXiv cs.LG22

    LDTool 与 HLDTool:从表格数据中可扩展提取并可视化多属性逻辑依赖与函数依赖

    罗斯托克大学等机构提出 LDTool 和 HLDTool,用于从表格数据中提取并可视化多属性逻辑依赖(LD)与函数依赖(FD)。LDTool 将依赖发现扩展到成对关系之外,HLDTool 通过超图引导的搜索空间缩减实现可扩展提取。在 3 个模拟和 11 个真实数据集上,LDTool 在高维特征空间中以更低运行时间复现了现有 FD 发现方法的相同结果,HLDTool 则支持数百个特征的依赖发现。

  5. arXiv cs.LG23

    选择性标签下的表演性预测:NeurIPS 2026 论文提出鲁棒优化方法

    针对表演性预测中仅能观测到被接受子集标签的"选择性标签"问题,研究者形式化定义了该场景,并证明仅用观测数据重训练会误导过程、破坏收敛保证。他们提出基于正标签概率置信区间的最坏情况目标,对其实施重复风险最小化(RRM)可将结果保持在真实稳定点的有界距离内。在带公平正则化的借贷实验中,该鲁棒优化方法性能接近拥有完整标签访问权的 RRM。

  6. arXiv cs.LG12

    优化编码器:重新思考神经场的二阶元学习

    研究者提出"优化编码器"视角,将神经场中的隐变量优化统一为编码过程,并据此推出基于等变 Transformer 的神经场模型 MetaLF。MetaLF 通过自注意力对隐变量点云进行上下文化,在图像与 3D 形状重建中仅需 3 到 5 次梯度更新即可提升保真度,并支持图像、形状与体数据的语义预测。

  7. arXiv cs.LG22

    面向 LoRA 的黎曼几何:一种新的预条件度量

    研究者提出一种专为 LoRA 定制的新黎曼度量,利用 $(B, A) \sim (BG^{-1}, AG^\top)$ 等价关系诱导的商流形,在每次梯度步引入预条件。理论上证明该预条件使 LoRA 的权重更新方向最接近全量微调的梯度方向,且更新后权重矩阵在 Frobenius 范数上比常规预条件和无预条件更接近全量微调。语言与视觉领域的微调实验验证了其有效性与效率。

  8. arXiv cs.LG22

    SepsisLens:面向可分解早期脓毒症预警的结构保持序列建模

    SepsisLens 通过保留变量索引的时间状态实现可分解的早期脓毒症预警,在风险合成前不压缩变量维度。该模型在三个公开 ICU 队列和一个私立医院队列上均取得强判别性能,并在 MIMIC-IV 上于相同事件召回率下降低告警负担。结构消融支持其设计,输入侧掩码显示排序分量反映了对预测影响更大的变量。

  9. arXiv cs.LG22

    分子编码器能否在没有实验读数的情况下预测表型活性?

    研究评估了 CLOOME、CellCLIP 等基于分子-形态配对数据对比预训练的分子编码器能否作为表型预测的廉价替代方案。在控制预训练边界泄漏和表型活性与细胞毒性相关性两个混杂因素后,六种表征(含匹配 CLOOME 输入与层数的非预训练 MLP 对照)在两个 Cell Painting 筛选中均显示,预训练分子编码器相较普通理化描述符无明显优势,且毒性通常比表型活性更易预测。

  10. arXiv cs.LG22

    模型合并再审视:重新思考任务算术带来的隐式正则化

    研究发现,模型合并中通过额外数据集搜索任务权重更新线性组合系数的标准做法,会引入一种隐式正则化,将候选模型限制在任务权重更新张成的子空间内。实验表明,去掉这一正则化直接优化合并模型权重,可在多种架构和领域显著提升常见合并方法的表现,甚至在每类仅一个样本的极端数据受限场景下依然有效;直接优化预训练模型权重也能超越部分现有合并方法。

  11. arXiv cs.LG22

    ApexQuant:无需数据的弹性量化,通过残差重各向同性化实现

    ApexQuant 是一种无需校准的量化方法,通过递归重量化残差误差,可作为现有量化器的精炼层。该方法在四个开源 LLM 及地球观测和医疗领域验证,4 bit 下接近全精度,并给出所测最佳 2 bit 方案,完全无需数据。每个前缀本身即为有效的低比特模型,单一产物可服务多种精度。

  12. arXiv cs.LG22

    Negative-Policy OPD:用负策略 rollout 增强在策略蒸馏

    研究提出 Negative-Policy OPD(NP-OPD),在 rollout 阶段引入能力更弱的负策略,持续提供负策略偏好但教师不偏好的 token,使其始终处于教师监督之下,从而在保留正向教师监督的同时补充显式负向信号。实验显示 NP-OPD 在多种模型规模、生成模式、推理领域和不同 OPD 变体上均优于 OPD,并能有效抑制负策略偏好的 token、使学生远离负策略。代码将公开。

  13. arXiv cs.LG17

    基于决策聚焦学习的个性化车辆轨迹路径复现神经优化框架

    该研究将个体路径复现建模为基于学习到的驾驶员特定隐式路段成本的最短路径问题,提出包含感知模型与约束优化层的神经管线,并采用决策聚焦学习实现端到端训练,通过隐式最大似然估计(iMLE)近似非可微层的梯度。实验表明该框架在路径复现上优于基线路径选择模型,学到的隐式成本可作为感知出行成本的代理,解释异质性路径选择。

  14. arXiv cs.LG20

    FreshCast:为冻结的时间序列预测模型刷新检索记忆

    FreshCast 是一个即插即用检索框架,在保持预测模型冻结的前提下,用新观测持续更新非参数记忆,并通过关系核回归生成记忆预测、在验证集上闭式校准其权重。在七个基准和十种预测架构上,FreshCast 对每个模型和输入长度都降低了平均 MSE,输入长度 96 和 720 时分别降低 14.6% 和 5.6%。

  15. arXiv cs.LG12

    TTNet:面向智能乒乓球拍球员分析的多任务深度学习模型

    TTNet 是一种结合 CNN、ResNet 与自注意力机制的多任务深度学习模型,可基于智能乒乓球拍采集的六轴传感器数据,同时预测球员性别、持拍手、球龄和技能水平四项属性。该模型采用两阶段训练策略,引入数据增强与任务专属损失函数以提升不平衡数据上的泛化能力,在 AI CUP 2025 乒乓球智能球拍数据分析竞赛官方榜单上获得第二名。

  16. arXiv cs.LG24

    αTransfer:用小模型迁移合并系数,实现高效模型合并

    模型合并需搜索最优合并系数,随模型规模和数量增长成本极高。αTransfer 发现同一模型族内不同规模模型的合并系数性能分布高度一致,可先在小代理模型上搜索系数再直接迁移到大模型。实验显示,该方法在视觉 Transformer 上提速 6 倍、内存降低 70%,在大语言模型上提速 20 倍、内存降低 85%,性能相当。

  17. arXiv cs.LG22

    通过对抗强化学习改进论辩挖掘的合成数据生成

    研究提出一种对抗强化学习框架用于论辩挖掘(AM)的合成数据生成,生成器产出结构化 AM 实例,判别器通过区分真实与合成数据提供学习信号,二者在对抗循环中联合优化。实验表明,该框架在三个基准数据集的全数据和低资源设置下均持续提升 AM 性能。该工作已被 EMNLP 2026 Findings 接收。

  18. arXiv cs.LG22

    MS-ECG-FM:用多源对比学习打造更通用的心电监测基础模型

    研究团队提出心电基础模型 MS-ECG-FM,通过对比对齐 ECG、超声心动图、放射和出院报告等多种临床记录类型进行训练,突破以往仅依赖 ECG 解读报告作为监督的局限。在扩展的 ECG 检测基准上,该模型在 ECG 可检测的全部病症范围内全面超越现有方法,在减少导联配置下同样表现优异。不同报告分别提升不同诊断领域的表征,多源对齐则捕捉其互补信息,在临床多样化任务上保持稳定强劲表现。

  19. arXiv cs.LG17

    Hub for Outliers, Spokes for Inliers:面向双重失配半监督学习的均匀隐空间构建

    针对半监督学习中标注与未标注数据在类别分布和标签空间上双重失配的问题,研究者提出 hub-spoke 隐空间几何结构,让已知类均匀分布在中心 hub 周围并各自围绕原型形成紧凑簇,hub 同时作为高不确定性未知类样本的低证据区域锚点。该方法结合基于证据的分类器,通过结构化特征组织缓解多数类主导,提升特征判别力与不确定性分离能力。实验显示其优于现有 SOTA 方法,在不同设置下最高提升 3.25%。

  20. arXiv cs.LG22

    TAFFY:带上下文多样性的任务自适应表格基础模型

    TAFFY 是一个结合 In-Context Diversity Prior 与 Task-Conditioned Looped Transformer 的表格基础模型,通过从共享因果过程经受控干预和分布偏移生成的多个相关环境中采样来构建合成预训练上下文,并迭代地选择性应用共享 Transformer 块进行任务自适应精炼。在六个分类和五个回归基准数据集上,TAFFY 取得最低平均排名。

  21. arXiv cs.LG22

    Global Transport:面向无分类器引导流模型的全局传输耦合

    研究者提出 Global Transport(GT),一种不依赖类别标签的全局类别无关最优传输耦合,用于条件流模型的训练。GT 单独使用会因将不同条件关联到源噪声不同区域而降低性能,但与无分类器引导(CFG)结合后,在离散类别和连续文本条件的图像生成中,跨模型规模和采样预算均稳定提升生成效果。该结果表明耦合设计应在推理时的引导流下评估,可作为无需改动架构、采样器或引导机制的训练期优化手段。