跳到正文
10月7日周三
  1. arXiv cs.LG22

    语言能保留多少地点信息?零样本语言推理用于跨视角地理定位

    研究用多模态大语言模型将地面全景与卫星瓦片描述为结构化文本,在无训练条件下完成跨视角地理定位。在四个美国城市 9,826 对 VIGOR 数据上,全库描述相似度排序的 Recall@1 仅 0.39%;缩小到十个邻近瓦片后,MLLM 评判器打分可达随机排序的两倍,并能指出两段描述中一致与冲突的字段。

  2. arXiv cs.LG22

    HCMAN:融合乳腺钼靶与临床数据的混合跨模态注意力网络,用于低资源地区早期乳腺癌检测

    混合跨模态注意力网络(HCMAN)通过 Transformer 跨模态注意力机制融合乳腺钼靶图像与结构化临床数据,在埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张钼靶图像上实现 97.8% 准确率、97.2% 敏感度、98.3% 特异度和 0.987 的 AUC,显著优于纯图像基线。

  3. arXiv cs.LG12

    量子变分自编码器(QVAE)如何学习解耦表征

    研究探讨了量子变分自编码器(QVAE)能否学习解耦且可解释的潜在因子,并厘清了单个量子潜在维度的定义。在包括 MNIST 变体在内的三个数据集上,QVAE 能够发现因子化且语义可解释的潜在表征,单个量子比特可作为有意义的潜在因子。该结果为理解量子潜在空间及其结构化表征学习潜力奠定了基础。

  4. arXiv cs.LG17

    交错投影梯度下降:面向安全模仿学习的神经网络控制策略

    研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。

  5. arXiv cs.LG31

    VAE 潜在空间中的颜色对齐及其应用:从 SD1.5 到 FLUX.2 的跨模型颜色子空间研究

    研究发现,从 SD1.5 到 FLUX.2 和 Z-Image 的多种文生图模型 VAE 共享一个与亮度和对立色对齐的颜色子空间,该子空间通过编码器线性近似和潜在引导被一致地定位。基于此提出三项应用:ColorTuning 在 GenColorBench 的 CSS3/X11 细粒度颜色系统上实现 SOTA 精确数值颜色生成,以及饱和度控制和颜色迁移。代码与模型已公开。

  6. arXiv cs.LG18

    ImpactMat:面向逆向撞击声渲染的连续材质估计数据集与基准

    ImpactMat 是面向逆向撞击声渲染的数据集与基准,提供单一及混合材质的撞击声样本并配对真实材质参数,同时提出一个前馈模型,可从一段或多段录音中预测材质参数,并利用混合材质学习材质类型间的平滑过渡。实验显示该方法优于竞争基线,无需人工调参即可从真实录音重新渲染撞击声。

  7. arXiv cs.LG22

    OCBench:可复现行为克隆谜题的机器人操作基准

    研究者提出 OCBench,一个带可控脚本策略的机器人操作基准,其脚本策略具备与人类演示相似的关键特性,从而在受控环境中复现了行为克隆的多种反常现象,例如模型对数据过拟合越严重性能反而持续提升、无动作分块的完全闭环策略往往彻底失败。OCBench 依托 GPU 加速环境和脚本策略,可对以往报道的 BC 相关现象展开分析并证伪多种假设。

  8. arXiv cs.LG22

    FactorBench:面向组合的自动化因子挖掘基准

    FactorBench 是一个面向组合的自动化因子挖掘基准,对比了 9 种自动化挖掘方法在 5 个股票市场上挖掘的约 5000 个因子。该基准从因子有效性、时序泛化性、风险与风格暴露后的预测能力,以及方法内与方法间因子池的差异性(含与 Alpha101 的相似度)三个层面追踪挖掘系统输出,并评估复合信号质量与计入成本后的多头及多空组合表现。结果显示,没有任何一种范式能持续占优。

  9. arXiv cs.LG12

    稀疏 Lévy 图上的非局部哈密顿动力学:谱分析与多模态采样

    研究者提出一种稀疏图方法,通过阻尼非局部哈密顿动力学将概率质量输运至多模态目标分布,结合对数均值迁移率与对称 Lévy 型交互权重,并用最近邻连接加采样长程边实现空间分离区域间的直接质量交换。图构建完成后密度演化是确定性的,每次更新成本与节点数及长程采样预算成线性关系。合成多模态分布实验显示,相比一阶与 MCMC 基线,该方法模态平衡更好、模态覆盖更稳定。

  10. arXiv cs.LG26

    四旋翼飞行控制的统计湍流与高保真扰动场:风场保真度对 PPO 策略鲁棒性影响研究

    一项针对四旋翼飞行控制的研究对比了从无风、离散 1-cosine 阵风、统计湍流、合成相干结构到大气边界层大涡模拟场的五种扰动保真度,在全交叉训练-测试矩阵中评估 PPO 智能体,并以级联 PID 和几何 SE(3) 控制器作为免训练参照,风速扫描范围 0-12 m/s。

  11. arXiv cs.LG22

    SynEval:面向多表合成数据生成的六维评估框架

    研究者提出 SynEval,一个面向多表(关系型)合成数据库的六维评估框架,联合评估逐列保真度、多变量结构保持(含条件分布检查 P(Y|X))、跨表完整性、ML 效用、隐私保护与边缘情况鲁棒性。该框架输出统一的加权质量分,支持按表和按维度下钻,且与生成器无关,可对任意真实与合成 CSV 文件夹自动推断 schema 并运行。

  12. arXiv cs.LG24

    什么是 Fréchet 距离?一种方向性分解方法

    研究提出方向性 Fréchet 距离,即最优传输位移在给定方向上的期望平方投影,用于揭示生成模型评测中差异的具体来源。在图像、视频和蛋白质案例中,少数可解释方向即可解释大部分距离,并据此解释了 COCO 数据集上扩散采样步数增加导致 ImageReward 提升但 FID 变差的现象,量化了 FVD 对逐帧外观的偏好。代码已开源。

  13. arXiv cs.LG16

    精确滑动窗口约束下的线性 Bandit 问题研究

    研究精确滑动窗口约束下的线性 bandit:离线场景下凸性与循环平移不变性使平稳解在 w∣T 时最优,否则存在 O(w) 加性差距;在线场景仅靠几何结构不足以学习,甚至可能无法实现次线性 regret。作者引入转移直径 τ 与稀有切换 OFUL 算法,regret 为 Õ(d√T+τd+w),并在去除循环不变性后引入历史状态直径 D,取得 Õ(d√T+dD+w) 的 regret 界。

  14. arXiv cs.LG17

    鲁棒 bandits 的计算可解性研究:识别多项式时间可学习特例并证明其小推广为 NP-hard

    针对鲁棒 bandits(原 imprecise bandits)此前只有 Θ(√T) 遗憾保证而无计算保证的问题,研究者识别出一个可用多项式时间学习器实现 Õ(√T) 遗憾的特例,并证明该特例的若干小推广均为 NP-hard,表明其处于可解性边界。作者称这是朝着用计算高效学习器解决 AI 对齐问题方向的一小步。

  15. arXiv cs.LG17

    在线逆优化实现最优遗憾与多项式时间:确定性算法回答 Sakaue 开放问题

    针对在线逆线性优化,研究者提出一种确定性算法,在任意时间跨度 T 下取得 O(√d) 的最优遗憾,且运行时间为 d 和 T 的多项式级。此前 Sakaue 用随机算法达到该最优遗憾,但每轮需 (dT)^{O(d)} 次线性优化,并公开询问能否在多项式时间内实现。新算法是 Sakaue 等人与 Cai 等人变尺度算法的变体,当查询点远离更新位置时撤销度量更新。

  16. arXiv cs.LG24

    GeneICL:面向批量转录组学的表格基础模型

    GeneICL 是一个 4.2M 参数的表格基础模型,通过基于实测批量表达谱构建的半合成预训练先验与参数高效循环架构,在 80 项临床结局预测任务中取得最佳综合排名,参数最多减少 387 倍,推理无需梯度更新,笔记本 CPU 上数秒即可完成预测。该模型还通过 Cox 偏似然残差将右删失生存预测无训练地归约为回归任务。

  17. arXiv cs.LG26

    高斯过程因果模型离散结果的反事实概率推断

    研究提出统一概率框架,将 GP 预测器与显式外生噪声机制配对,为二元、名义和有序离散结果分别推导精确的条件噪声反演方法,并证明其能复现拟合模型的观测与干预分布。在合成 SCM 上,对有序数据误用分类耦合会使反事实误差膨胀约三倍,且该误差不随数据量增加而下降。

  18. arXiv cs.LG12

    VOCEM:用联合效应建模实现方差最优的离策略评估

    针对上下文赌博机离策略评估中动作级重要性权重方差过大的问题,研究者提出 Variance Optimal-CEM(VOCEM)估计器,在 OffCEM 与 Doubly Robust(DR)之间插值并选取使方差最小的系数,推导出闭式总体最优解,其方差不超过两个端点。在受控合成实验和两个大动作基准上,VOCEM 在全部 23 种评估条件下均优于 OffCEM 和 DR,稳定性与经验鲁棒性更强。

  19. arXiv cs.LG15

    基于游戏画面深度学习的多标签感知 Bug 检测

    研究提出 ResNet-BiLSTM 模型用于游戏画面多标签感知 Bug 检测,在基准数据集上取得 85.78% 的 F1 分数,优于 Inflated 3D ConvNet 和 3D ResNet 等视频分类模型。结果表明时序依赖建模有助于提升基于视频的 Bug 检测准确率。研究同时发布新数据集,包含 77,969 个视频片段、约 120 万帧,覆盖 5 类 Bug 在同一帧中的组合。

  20. arXiv cs.LG17

    奇异值分解的几何重发现:当证明变成算法

    一篇 31 页的 arXiv 文章以几何方式重新推导奇异值分解(SVD),主张其构造正是主成分分析、核方法与 PageRank 背后的机制。文章先由单位圆到椭圆的映射推出奇异值,再用该构造证明谱定理而非假设它,并说明最大化递归对应幂法与 PageRank、定位极大值的引理对应梯度下降的停止规则。

  21. arXiv cs.LG22

    Bregman 散度如何塑造 Shampoo 优化器

    研究提出统一 Bregman 散度框架,将 Shampoo 优化器中 Frobenius、KL 等散度选择纳入同一视角联合分析。通过梯度二阶矩的谱分析发现,部分散度能更好补偿有限样本下二阶矩的低估,解释了不同 Shampoo 变体的行为差异,并在 GPT-2 预训练实验中验证。

  22. arXiv cs.LG18

    STEP-KD:面向早期芯片时序预测的序贯知识蒸馏

    针对早期阶段数据预测布线后时序的难题,研究者提出 STEP-KD,利用布线后、布局后、floorplan 后各阶段教师模型,通过表征对齐将知识序贯蒸馏到综合后学生模型。实验显示其将 Total Negative Slack 预测的加权平均绝对百分比误差降至 19.78%,而业界标准 STA 工具为 74.84%。