EigenDEXplore:用人类先验结构化探索的灵巧操作强化学习
针对灵巧操作中独立关节扰动难以发现协调行为的问题,研究者提出 EigenDEXplore,通过沿人类手部数据导出的特征向量方向添加扰动来诱导相关探索,同时保持动作空间不变。在多种灵巧手上,该方法在抓取、手内重定向和接触丰富操作中持续优于关节空间和学习动作空间基线,并适用于无结构及参考引导的 RL、轨迹优化和 sim-to-real 部署。
针对灵巧操作中独立关节扰动难以发现协调行为的问题,研究者提出 EigenDEXplore,通过沿人类手部数据导出的特征向量方向添加扰动来诱导相关探索,同时保持动作空间不变。在多种灵巧手上,该方法在抓取、手内重定向和接触丰富操作中持续优于关节空间和学习动作空间基线,并适用于无结构及参考引导的 RL、轨迹优化和 sim-to-real 部署。
研究提出归一化精确解体积(NESV)指标,用于衡量 Transformer 解在更长输入上的泛化能力。对固定宽度单层 Transformer,FIRST 和 MAJORITY 任务的 NESV 为 Θ(1) 和 Θ(1/(n log n)),INDEX 为 Θ(1/n³),PARITY 为 0。
加州葡萄园精准病害防控项目评估了两种人机协作工作流。Workflow 1 中,多智能体研究系统 Aleks v1 在 145 分钟内开发出 vine-scale 预测模型,在回顾性模拟中对 45% 藤蔓位置进行侦察,模型辅助行优先级排序将新记录红叶观测的遇到比例从 85.8% 提升至 94.1%。
CACHEFORGE 是首个将大语言模型嵌入硬件感知闭环、端到端演化缓存替换策略的框架,每轮由 LLM 生成新的 C++ 替换逻辑,并在 CRC-2 ChampSim 模拟器上评估。
SWORD 是一个联合优化多智能体工作流拓扑与自然语言提示词的框架,仅依靠标量任务指标引导,无需领域初始化或任务特定工程。在相同骨干模型的受控对比下,SWORD 相较仅提示词、仅工作流及分阶段优化基线均取得统计显著提升,并在使用更小骨干模型、更少训练数据和每数据集 4–6 美元 API 成本的情况下,准确率超过最强的已发表领域专用基线。
研究发现,安全对齐但被植入后门的教师模型可通过 on-policy distillation(OPD)将隐藏恶意行为传给原本干净的学生模型,3% 投毒率下攻击成功率(ASR)最高达 70%。
研究团队推出 SMART 系统,并构建了关节感知仿真平台 SMART-Sim,合成出包含超 100 万条演示、覆盖 44 种原子任务类型、5 种机器人配置和 2,507 个关节物体的 SMART-Data 数据集。基于该数据预训练的 VLA 模型在仿真基准上表现有竞争力,并实现零样本 sim-to-real 迁移,在真实世界关节物体操作任务中展现出可扩展性能。
研究者提出 SkillPoison 框架,通过构造强化目标行为的成功经验、再移除约束该行为适用场景的上下文条件,实现对自进化 LLM 智能体技能库的渐进式投毒。在三个 benchmark 上,该方法攻击成功率达 95.71%,且所有注入经验均保持任务正确、可通过验证与词法检查。代码与数据已公开。
研究者提出免训练的 KV cache 驱逐方法 LORE-KV,通过从冻结目标模型采样短自回归续写、用其响应侧 query 状态估计 prompt token 效用,把固定预算的未来感知驱逐建模为分布估计。
研究提出线性适应度子空间(LFS)假设,认为突变引起的残基级表示变化中存在一组紧凑的、测定特异的方向,使适应度变化可从少量标注变体中线性获取。基于此提出的子空间引导进化搜索(SGES)在 10 个核心 ProteinGym 测定、87 个扩展静态验证测定和 18 个测定预算搜索评估中,适应度预测与搜索效率均优于零样本 PLM 及近期 ML 引导的蛋白质优化基线。
研究提出选择性情感层微调框架 SALFT,用于视频 Vision Transformer 的玩家唤醒度识别,通过层参数 L2-norm 变化筛选微调层,仅更新约 8% 参数(减少超 92%)。
互补特征域(CFD)理论指出,Shannon 信息保留并不意味着预测贡献系统被保留:可逆表示变换可在目标信息不变的情况下改变受限决策族下的预测贡献。研究用 CFD 贡献缺陷量化受控重编码下的上下文贡献变化,并证明在有界 Lipschitz 效用下,每个上下文贡献缺陷受相应联盟不相容性之和约束。
研究者提出数据中心化框架 GRADE(GRadient-Aligned Data-centric rEcipe),通过状态感知采样器持续准入与多任务梯度场对齐的样本,并用自校准步级门控拒绝接近饱和时可能造成破坏性覆盖的更新。在三种当前代骨干模型和七个异构指令数据集上,GRADE 在准确率与鲁棒性上优于强数据选择和 PEFT 稳定化基线,是唯一在每个架构上都稳定优于标准 LoRA 的方法。
研究发现有害合规 SFT 会在 LLM 检查点更新空间中留下连续、与目标相关的排序痕迹,检查点级坐标 s_H 在四个 7-8B 基座模型上与有害目标组成的 Spearman 相关性达 0.986-0.992,且该排序在更大规模模型上依然保持。
多智能体共享成本预算时,统一 Lagrange 乘子只能约束总量、无法决定惩罚如何在各智能体间分摊,为此研究者提出 Lagrangian Responsibility Allocation(LiRA),通过有限训练周期内优化社会福利来学习每个智能体对公共乘子的分摊比例。
研究推导出功耗轨迹无法排除的最大隐藏算力占比 β 的闭式解:在 NVIDIA A100 GPU 上最坏情况 β = 1.16,对抗性等能量策略至少可隐藏 β = 0.41 的算力,说明仅靠模拟功耗测量对算力的约束很弱。若验证方能在观测工况下重新执行申报的工作,β 最多可降至 0.059。
研究者提出一种组合 Thompson 采样(CTS)变体:用 LLM 查询一次臂的分区,经 RBF 核转换为正定相关矩阵 Σ,每轮后验样本按 Σ 采样,而 Beta 后验仍只用真实奖励更新,让 LLM 影响采样器的移动方式而非其信念。
针对纵向研究中预测精度与参与者负担的矛盾,研究者提出一种树蒸馏方法,从基于神经网络的 Longitudinal Active Feature Acquisition(LAFA)网络中学习可解释策略。该方法在模拟实验和预测每日饮酒量的 EMA 实证数据集上验证,均能在精度损失极小的前提下显著减少每次采集的条目数量。
研究者提出 BeFOND,一种无编码器的稀疏编码模型,将推理与字典学习统一为共享变分自由能上的自然梯度流,具备闭式推理与学习动态。在合成数据上,BeFOND 提升了字典恢复与稀有特征检测能力,且随叠加程度增加对 amortized 基线的优势扩大;在语言模型激活上,它以更少训练数据超越预训练参考 SAE,特征质量随字典宽度持续提升。
研究者提出深度联合模型 DeepAJM,无需参数假设即可同时建模纵向与生存结局,并通过可部分解释的关联结构将纵向过程与生存风险相连。该模型在心血管疾病 EHR 队列、原发性胆汁性肝硬化(PBC2)数据集和模拟数据集上,与经典参数联合模型、TransformerJM、DA-LSTM 及基于 Cox 的生存模型对比,在 C-index、时间依赖 AUROC 和 AUPRC 上均取得最佳区分度。
研究者发布 SEMAADB 数据集与基准,包含 3,000 个工程上下文和 15,000 张图,每个上下文含 Requirement、Block Definition、Activity、State Machine、Sequence 五个相互关联的 SysML 视图,其中 100 个上下文经人工核验构成测试集。
RELACE 是一个无需 critic 的框架,通过教师强制似然评分对比动作在原始上下文与结果增强上下文中的可能性,生成轨迹归一化的回顾因子,用于重加权折扣任务回报并构建局部优势。
针对蛋白质-分子虚拟筛选,研究者提出因果建模方法 CausalBind,通过 V-structure 因果模型和 Heckman 式选择形式化稀疏交互先验,并证明在结构稀疏条件下交互概念可识别。
研究者发布 TC3-VQA 数据集,用于将伤情视觉观察与战术战伤救治(TC3)临床指南相连接。该数据集由公开教学与实战视频及权威 TC3 文档构建,含 581 个条目、11 个概念和 1,860 个问题,覆盖干预识别、教义、临床推理、流程指导及视觉信息不足时的拒答。
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。
时间序列基础模型(TSFM)常用的 ReVIN 等仿射缩放方法会在反变换后计算损失,使每条序列的梯度被乘以 b^p,导致高尺度序列主导训练,作者称之为尺度污染训练(ScaleCon)。
研究者提出 Analytical Memory Unit(AMU),为每条缓存结果附加完整派生(血缘)图,并只在请求者对所有涉及列均有权限时才返回命中,从而阻止经由合法计算结果泄露敏感列。
研究者提出最小见证强化学习(MWRL),将"找出全部最小充分见证"形式化为最小见证识别问题,仅凭单个黑盒验证器的反馈位即可完成信用分配。该方法从问题定义直接推导,统一了最小性与备选解恢复两项要求,并据此给出可恢复完整见证族的值迭代规划器和可扩展到大语言模型的策略梯度方法。实验中 MWRL 能找回大部分最小见证,而其他方法只返回冗余超集或单一见证。
TIDE 2.0 是一个 MIT 许可的开源引擎,采用可替换识别器与键控匿名器两阶段设计,支持机构本地部署,替代符以密码学生成且不存储关联表,日期按患者做保持间隔的偏移。
RoboCap 是一个 250g、六摄像头、双 IMU 的帽子式设备,用于在真实环境中采集第一人称操作数据,配套的 Grounded API 提供与设备无关的 3D 算法。该平台在公开基准上取得 SOTA 表现,涵盖多场景 SLAM、第一人称深度估计,以及适配第三方设备的手部追踪。
研究者提出 DRMoET,一种将逐层专家视为内生鲁棒分组、优化高损失路由结果的即插即用目标,而非仅均衡流量。在 FLAME-MoE 配方下,10.3B 总参数、67B 训练 token 时,DRMoET 将七任务平均分从 0.6625 提升至 0.6767,无辅助损失均衡基线为 0.6431。强制 mid-k 误路由下超额损失降低 4.3%,专家损失方差下降而均值几乎不变。
研究者发布首个可端到端评估 Croissant 元数据提取的基准,含 602 篇论文,其中 102 篇有人工验证的 gold 标注、500 篇为 LLM 生成的 silver 标注,覆盖 Croissant 完整 schema 及 RAI 字段。
研究提出 EDI 约束的图摘要方法 AURORA,将用户偏好建模为加权属性二部图,用贪心粗化算法在合并用户节点时强制满足公平差距(ΔE)、列表内多样性(ILD)和群体包容三项结构约束。
LiLib 是一种面向 UAV 的轻量级持续学习方案,通过维护一个小型递归最小二乘专家库,用窗口残差检验检测漂移,再经短探测阶段复用或新建专家。
研究指出 Muon 优化器对矩阵更新有清晰解释,但卷积核以四维张量存储,标准实现将其 reshape 为矩阵的做法破坏了其理论基础。为此研究者提出 Convolutional Newton-Schulz(Conv-NS),直接在卷积算子几何中逼近极因子并保留核支撑。
T-CCL 是一个基于 Tensor Memory Accelerator(TMA)的节点内集合通信库,将数据搬运与归约操作卸载到 TMA,以流水线式异步 TMA 操作执行集合通信,在保持高带宽的同时降低 SM 资源占用。
一项研究提出仅靠单个前置 RGB 摄像头和图神经网络,将模拟火车司机状态分为警觉、非警觉和紧急三类。消融实验显示,在光照条件下融合面部与骨骼特征的三分类模型准确率达 81%,二分类警觉/非警觉准确率达 99%,优于仅用面部或骨骼特征的模型。研究同时发布了一个涵盖三种光照条件的受控 RGB 视频数据集。
研究者提出 macro2mind,用 GRPO 结合预测市场价格信号训练语言模型,将行为推理拆解为推断市场参与者群体、预测其信念更新并聚合为价格的显式步骤。该方法在 SWM-Bench 的 Polymarket 数据上取得 SOTA 方向准确率与相关性,并零样本迁移至 Humanual、OvertonBench、PRISM、CAD 四个用户模拟基准。
TRIAGE 是一种方向感知的稳定方法,通过段级诊断选择性再平衡策略梯度更新,并对残余严重失配做有界修复,从而在采样器和学习器上保留原生 NVFP4 的 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,该方法在整个训练周期内保持稳定优化,在五个数学推理基准上达到全精度水平,rollout 吞吐量较 BF16 最高提升 2.3 倍。
研究将知识蒸馏与量化联合应用于法译英生物医学翻译,蒸馏并量化的学生模型相比原始基线体积缩小69%、推理速度提升98.21%、CO2排放降低98.46%,且未牺牲翻译质量。该工作还开发并比较了多种微调策略,以让压缩后的学生模型适应专业术语密集、平行语料稀缺的低资源领域。