跳到正文
10月7日周三
  1. arXiv cs.AI33

    SMART:通过大规模合成预训练实现零样本仿真到现实的关节物体操作

    研究团队推出 SMART 系统,并构建了关节感知仿真平台 SMART-Sim,合成出包含超 100 万条演示、覆盖 44 种原子任务类型、5 种机器人配置和 2,507 个关节物体的 SMART-Data 数据集。基于该数据预训练的 VLA 模型在仿真基准上表现有竞争力,并实现零样本 sim-to-real 迁移,在真实世界关节物体操作任务中展现出可扩展性能。

  2. arXiv cs.AI41

    SkillPoison:通过成功经验实现渐进式技能投毒

    研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。

  3. arXiv cs.AI23

    蛋白质语言模型中的线性适应度子空间实现样本高效定向进化

    研究提出线性适应度子空间(LFS)假设,认为突变引起的残基级表示变化中存在一组紧凑的、测定特异的方向,使适应度变化可从少量标注变体中线性获取。基于此提出的子空间引导进化搜索(SGES)在 10 个核心 ProteinGym 测定、87 个扩展静态验证测定和 18 个测定预算搜索评估中,适应度预测与搜索效率均优于零样本 PLM 及近期 ML 引导的蛋白质优化基线。

  4. arXiv cs.AI15

    互补特征域(CFD)理论:信息保留不等于预测贡献保留

    互补特征域(CFD)理论指出,Shannon 信息保留并不意味着预测贡献系统被保留:可逆表示变换可在目标信息不变的情况下改变受限决策族下的预测贡献。研究用 CFD 贡献缺陷量化受控重编码下的上下文贡献变化,并证明在有界 Lipschitz 效用下,每个上下文贡献缺陷受相应联盟不相容性之和约束。

  5. arXiv cs.AI22

    GRADE:面向数据中心化小语言模型微调的梯度准入方法

    研究者提出数据中心化框架 GRADE(GRadient-Aligned Data-centric rEcipe),通过状态感知采样器持续准入与多任务梯度场对齐的样本,并用自校准步级门控拒绝接近饱和时可能造成破坏性覆盖的更新。在三种当前代骨干模型和七个异构指令数据集上,GRADE 在准确率与鲁棒性上优于强数据选择和 PEFT 稳定化基线,是唯一在每个架构上都稳定优于标准 LoRA 的方法。

  6. arXiv cs.AI17

    用树蒸馏为纵向主动特征获取学习可解释策略,降低参与者负担

    针对纵向研究中预测精度与参与者负担的矛盾,研究者提出一种树蒸馏方法,从基于神经网络的 Longitudinal Active Feature Acquisition(LAFA)网络中学习可解释策略。该方法在模拟实验和预测每日饮酒量的 EMA 实证数据集上验证,均能在精度损失极小的前提下显著减少每次采集的条目数量。

  7. arXiv cs.AI24

    BeFOND:将稀疏自编码器的推理与学习统一为自然梯度流

    研究者提出 BeFOND,一种无编码器的稀疏编码模型,将推理与字典学习统一为共享变分自由能上的自然梯度流,具备闭式推理与学习动态。在合成数据上,BeFOND 提升了字典恢复与稀有特征检测能力,且随叠加程度增加对 amortized 基线的优势扩大;在语言模型激活上,它以更少训练数据超越预训练参考 SAE,特征质量随字典宽度持续提升。

  8. arXiv cs.AI17

    DeepAJM:面向不规则采样数据的深度关联联合模型

    研究者提出深度联合模型 DeepAJM,无需参数假设即可同时建模纵向与生存结局,并通过可部分解释的关联结构将纵向过程与生存风险相连。该模型在心血管疾病 EHR 队列、原发性胆汁性肝硬化(PBC2)数据集和模拟数据集上,与经典参数联合模型、TransformerJM、DA-LSTM 及基于 Cox 的生存模型对比,在 C-index、时间依赖 AUROC 和 AUPRC 上均取得最佳区分度。

  9. arXiv cs.AI29

    最小见证强化学习 MWRL:让模型从验证器反馈中学会完整见证族

    研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。

  10. arXiv cs.AI27

    DRMoET:分布鲁棒混合专家(MoE)训练方法

    研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。

  11. arXiv cs.AI22

    基于图神经网络的面部与上半身关键点火车司机状态识别

    一项研究提出仅靠单个前置 RGB 摄像头和图神经网络,将模拟火车司机状态分为警觉、非警觉和紧急三类。消融实验显示,在光照条件下融合面部与骨骼特征的三分类模型准确率达 81%,二分类警觉/非警觉准确率达 99%,优于仅用面部或骨骼特征的模型。研究同时发布了一个涵盖三种光照条件的受控 RGB 视频数据集。

  12. arXiv cs.AI23

    macro2mind:用预测市场信号训练 LLM 学习个体行为推理

    研究者提出 macro2mind,用 GRPO 结合预测市场价格信号训练语言模型,将行为推理拆解为推断市场参与者群体、预测其信念更新并聚合为价格的显式步骤。该方法在 SWM-Bench 的 Polymarket 数据上取得 SOTA 方向准确率与相关性,并零样本迁移至 Humanual、OvertonBench、PRISM、CAD 四个用户模拟基准。

  13. arXiv cs.AI22

    TRIAGE:面向原生 NVFP4 强化学习的方向感知失配稳定方法

    TRIAGE 是一种方向感知的稳定方法,通过段级诊断选择性再平衡策略梯度更新,并对残余严重失配做有界修复,从而在采样器和学习器上保留原生 NVFP4 的 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,该方法在整个训练周期内保持稳定优化,在五个数学推理基准上达到全精度水平,rollout 吞吐量较 BF16 最高提升 2.3 倍。

  14. arXiv cs.AI22

    知识蒸馏与量化压缩用于生物医学领域神经机器翻译研究

    研究将知识蒸馏与量化联合应用于法译英生物医学翻译,蒸馏并量化的学生模型相比原始基线体积缩小69%、推理速度提升98.21%、CO2排放降低98.46%,且未牺牲翻译质量。该工作还开发并比较了多种微调策略,以让压缩后的学生模型适应专业术语密集、平行语料稀缺的低资源领域。

  15. arXiv cs.AI22

    ReRAM 存内计算 CNN 加速器的故障脆弱性实证研究

    研究者开发了一套故障注入框架,在软件和硬件层面考察大规模 CNN 在 ReRAM 存内计算(PIM)加速器上推理时的脆弱性,通过将 CNN 学习参数映射到 ReRAM 交叉阵列并注入 stuck-at high(SaH)与 stuck-at low(SaL)故障,发现脆弱性受层类型与深度、参数在层内的位置以及故障取值与类型影响,且 SaL 比 SaH 造成更严重的分类精度下降。

  16. arXiv cs.AI30

    DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放

    DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。

  17. arXiv cs.AI27

    CrystalJev:用原子基础模型"快思考与慢思考"加速材料发现

    CrystalJev 将冻结的原子间势模型当作快速决策者,对未弛豫结构单次前向查询即可输出带校准概率的"稳定"判断,成本仅为弛豫计算的约三十分之一。在 65 个 Matbench Discovery 模型上,该方法用价值信息理论只在决策可能改变处调用慢速计算,并同样回答电子、力学与分子问题。

  18. arXiv cs.AI29

    仅用判决结果后训练小模型:拒绝采样与纯标签训练能否恢复证据?

    研究测量小语言模型仅凭判决结果后训练时的证据恢复能力,在 ContractNLI 上人类证据跨度留至评估阶段。纯标签训练达到准确率 0.896、跨度 F1 0.564,逐字引用率从 0.597 升至 0.729;拒绝采样达到 0.797 和 0.556,逐字引用率升至 0.701。两种方法都能在无人标注证据的情况下改善证据质量,但单一语料单一种子尚无法判定哪种更优。