跳到正文
10月7日周三
  1. arXiv cs.AI24

    Atom-JEPA:面向 3D 原子系统的联合嵌入预测架构

    Atom-JEPA 是一个自监督预训练框架,通过原子级和子结构级的互补目标,从无标注 3D 结构中学习潜在表示。该模型在大规模分子与晶体数据集上预训练,经微调后在分子 ADMET 与量子化学性质预测任务上达到 SOTA,在晶体材料物理性质预测上也极具竞争力。代码与预训练模型 checkpoint 已公开。

  2. arXiv cs.AI17

    利用历史数据缓解自动驾驶远程操控 QoS 预测中的概念漂移

    针对自动驾驶远程操控的预测性 QoS(pQoS),研究者基于实测数据提出预测框架,预测上行数据速率与往返时延两项网络 KPI。该框架将历史数据纳入预测流程,以缓解概念漂移导致的机器学习模型在未见数据上的性能退化,并引入关键场景检测指标专门评估远程操控场景下的预测表现。

  3. arXiv cs.AI29

    VOMMI:面向移动操作的可携带演示采集与学习框架

    VOMMI 是一个可携带的移动操作演示采集与学习框架,通过离线轨迹重建和在线视觉-运动条件化,将便携 RGB 演示接入 VLA 后训练。其 R2-VO 用稀疏几何锚点精修轨迹,使身体与手部流的绝对轨迹误差平均降低 24.6%。仅用便携演示后训练的策略基座速度误差比机器人采集演示低 18.2%,在三项真机任务上平均成功率较 OpenPI 0.5 提升 8.3 个百分点。

  4. arXiv cs.AI19

    STRUCTURALCOST:用于建模人类句子处理难度的受控阅读时间数据集

    STRUCTURALCOST 是一个自定速阅读数据集,包含 475 名参与者和 40,800 条观测,用于分离长距离主谓依存解析的处理成本。研究发现,主句动词处的人类阅读时间随依存长度增加,由句法嵌套而非线性距离驱动;n-gram、SSM 和 Transformer 等语言模型仅部分反映这一难度曲线,且低估了人类的工作记忆整合成本,该差距在不同架构和模型规模下持续存在。

  5. arXiv cs.AI24

    基于查询的可达自车未来代价学习:超越端到端驾驶的航点回归

    研究者提出一种基于查询的代价学习框架,为动态可达的自车轨迹查询估计有界代价,而非密集 BEV 网格或少量回归轨迹。在 nuScenes 上,该方法碰撞率优于 ST-P3、NMP 及多数回归基线,L2 保持竞争力;在真实驾驶日志上无需微调即比 SparseDrive 和 Alpamayo 降低碰撞率。该工作已被 ACCV 2026 接收。

  6. arXiv cs.AI22

    针对多语言语音匿名化的声学与内容导向说话人验证攻击研究

    研究评估了声学导向与内容导向攻击者对多语言匿名语音的说话人验证(ASV)效果,发现攻击效果取决于匿名语音的语言可用性。整体上声学导向攻击者表现更好,但当语言信息保留较好时,内容导向与声学导向攻击者的性能差距会缩小。研究还构建了多语言语音转换数据集,可提升性能并部分缩小跨语言差距。

  7. arXiv cs.AI22

    SAGE:语义锚点引导的医疗问答数据合成框架

    SAGE 是一个面向医疗问答的数据合成框架,利用 MeSH 等公开分类体系作为语义锚点,让本地部署的小模型通过原子与关联合成交替迭代,从极少种子数据生成高质量医疗训练数据。在多个医疗问答基准上,用 SAGE 合成数据微调的模型持续优于自生成或传统文档式方法,且无需大量医疗文档或外部 API。代码已开源,论文被 EMNLP 2026 收录。

  8. arXiv cs.AI22

    ReGraph:双视觉通路中涌现泛化能力的计算解释

    研究者提出 ReGraph——一种带生物归纳偏置的循环双流图模型,包含视网膜驱动的分流编码、背侧到腹侧调制和动态侧向连接,在 Something-Something V2 动作基准上训练。结果显示,上下文不变编码与网格样空间基仅沿扩展背侧通路共同涌现,单流、无调制变体和标准基线中均不出现。事后分析表明这些网格样基可作为可复用的路由模板,提示泛化能力在感觉信息被分解为层级化分流时便已成形。

  9. arXiv cs.AI17

    多模态知识蒸馏用于全切片图像胃腺癌分类

    研究提出多模态知识蒸馏(MKD)框架,用低秩多模态融合(LMF)结合预训练WSI图像编码器与临床文本编码器,教师模型学习图像-文本融合表示,学生模型蒸馏后仅凭图像即可推理。在PatchGastric基准上平均准确率比SOTA至少高3.35%,且不依赖Transformer融合、多任务学习或大语言模型,源代码已开源。

  10. arXiv cs.AI26

    基于控制的动态优化实现多样化运动定制

    针对视频生成中运动定制的内容泄漏问题,研究者提出 Control-based Motion Customization(CMC)训练框架,用随机最优控制(SOC)引导生成动态朝向目标运动、避免向参考视频坍缩。该方法去除显式奖励并引入仅作用于生成早期阶段的时间步自适应运动代价,训练速度提升 2.5 倍,在缓解内容泄漏的同时保持运动保真度与基座模型的多样性。

  11. arXiv cs.AI32

    统一多模态模型的视觉弃权能力:Draw-or-Decline 基准与 VisTA 训练方法

    研究提出视觉弃权概念,即模型在请求的视觉变换不可能完成时应识别并拒绝生成。为此构建了 Draw-or-Decline 基准,包含 7 类任务的 1,050 对可行-不可行请求,评测 8 个统一多模态模型发现编辑能力与弃权能力相互独立,最强编辑器编辑准确率 68.4% 却仅拒绝 0.4% 的不可行请求。

  12. arXiv cs.AI31

    六项童年协变量胜过所有 Transformer:从 11 岁作文预测 23 岁抑郁症状

    一项基于英国出生队列 National Child Development Study 的研究发现,用 11 岁作文预测 23 岁抑郁症状时,仅依赖六项童年协变量的逻辑回归基线 AUC-ROC 达 0.737,优于所有只看作文的文本模型,包括七个微调 Transformer、词袋模型、冻结嵌入和四个零样本大语言模型,其中最佳 Transformer 仅为 0.670。

  13. arXiv cs.AI22

    WASD:基于 Wasserstein 距离的大语言模型知识蒸馏方法

    研究者提出 WASD,一种基于 Wasserstein 距离的大语言模型知识蒸馏方法,通过由 token 嵌入构建的代价矩阵引入 token 级语义信息,并采用 Sinkhorn 散度推导出梯度等价目标以降低计算开销。在多个 LLM 系列和规模上的实验显示,WASD 在指令跟随、数学推理和代码生成等任务上持续提升蒸馏性能。该工作已被 NeurIPS 2026 接收,实现已公开。

  14. arXiv cs.AI22

    EigenDEXplore:用人类先验结构化探索的灵巧操作强化学习

    针对灵巧操作中独立关节扰动难以发现协调行为的问题,研究者提出 EigenDEXplore,通过沿人类手部数据导出的特征向量方向添加扰动来诱导相关探索,同时保持动作空间不变。在多种灵巧手上,该方法在抓取、手内重定向和接触丰富操作中持续优于关节空间和学习动作空间基线,并适用于无结构及参考引导的 RL、轨迹优化和 sim-to-real 部署。

  15. arXiv cs.AI22

    加州葡萄园病害防控项目评估两种人机协作工作流:Aleks v1 多智能体系统与人工侦察的实地对比

    加州葡萄园精准病害防控项目评估了两种人机协作工作流。Workflow 1 中,多智能体研究系统 Aleks v1 在 145 分钟内开发出 vine-scale 预测模型,在回顾性模拟中对 45% 藤蔓位置进行侦察,模型辅助行优先级排序将新记录红叶观测的遇到比例从 85.8% 提升至 94.1%。

  16. arXiv cs.AI22

    SWORD:面向用户行为模拟的工作流与提示词联合优化框架

    SWORD 是一个联合优化多智能体工作流拓扑与自然语言提示词的框架,仅依靠标量任务指标引导,无需领域初始化或任务特定工程。在相同骨干模型的受控对比下,SWORD 相较仅提示词、仅工作流及分阶段优化基线均取得统计显著提升,并在使用更小骨干模型、更少训练数据和每数据集 4–6 美元 API 成本的情况下,准确率超过最强的已发表领域专用基线。