OpenWAM:面向可组合世界-动作模型的开放框架
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
OpenWAM 是一个可组合世界-动作模型的开放框架,支持在模型内部及模型之间灵活组合视频与动作的生成顺序和注意力方式。其共享架构将 Wan2.2-5B 视频专家与 2B 动作专家组成 Mixture-of-Transformers,在约 334 万条轨迹、14.64k 小时视频上预训练,使用 32 块 NVIDIA B200 GPU 训练 14 天。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上进行持续预训练。
研究者提出 VT-MUSE,一个面向视触觉操作任务的多模态统一序列表征学习框架,通过两阶段学习解决视觉与触觉独立编码及忽略接触时序演化的问题。在仿真基准上,VT-MUSE 在所有任务上超越最强基线 11 个百分点,真实世界实验也取得显著提升。
DexPIE 是一个从真实部署经验中提升灵巧操作策略的后训练框架,通过适配灵巧手干预系统和多阶段 DAgger 式数据采集实现有效探索覆盖。在三个真实世界灵巧操作任务上,DexPIE 相比基于演示的参考策略成功率提升 37.3%,优于所有基线方法。源代码和数据集将公开。
HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。
PointZero 提出以 3D 点轨迹补全作为预训练目标,无需机器人动作标签即可学习可迁移的 3D 动态先验。研究团队构建了包含 290 万合成帧、覆盖可变形、铰接与刚性物体的数据集,并训练出基于 Transformer 的 PointZero,在相同数据上优于此前方法。
Con-DSO 是一个一致性感知的 RGB-D 直接稀疏里程计框架,用双分支一致性网络在相邻 RGB-D 帧对上预测像素级光度与几何不确定性,并将其转化为成对质量以指导支撑像素选择,再跨帧融合为关键帧跟踪的质量先验。
WareFly-VLA 是一个面向智能仓库的写实无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 个高分辨率 RGB 转换,覆盖目标接近与人员跟随两类任务。
基于 Wan2.2-5B 构建的开放世界-动作模型框架 OpenWAM 发布,通过共享 Mixture-of-Transformers 架构集成动作专家,支持联合、先视频后动作、先动作后视频及解耦四种生成方式。
ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。
PhysTacGen 是一个视觉到光学触觉图像生成框架,通过融合材料感知描述与几何条件来合成触觉图像。
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
EmbodiedSmith 是一个通过递归自我改进(RSI)实现可扩展具身数据生成的框架,将资产、场景与任务生成统一到一条支持自主创建和语言驱动定制的流水线中。
研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。
研究提出一种统一的自回归扩散图生成模型,联合学习结构与特征,从观测到的垂直平面自底向上构建任意层级深度的完整3D场景图(3DSG)。该方法在合成场景、真实建筑平面图和机器人传感器数据等3DSG数据集上持续超越所有基于学习和随机的基线,并在最大层级和真实单层数据上超越可获取目标图尺寸的one-shot模型。
VLLR 是一种结合 LLM/VLM 外部奖励与策略自确定性内在奖励的稠密奖励框架,无需人工奖励工程即可微调机器人基础策略。在 CHORES 基准上,VLLR 相比预训练策略成功率最高提升 56%,在分布内任务上超越 SOTA RL 微调方法最高 5%,分布外任务最高提升 10%。该工作已被 IROS 2026 接收。
研究者提出一种仅以奖励和动作为条件的奖励策略,可在观测空间完全不同的源环境与目标环境之间实现零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练后,可零样本迁移到不同配色、3D 渲染以及 Habitat-Sim 中的 Stretch 机器人导航任务。基于奖励的策略还能进一步引导目标环境中基于观测的策略训练。
研究者提出 Learning from Hindsight(LfH),用预训练视觉语言模型为失败的 rollout 重新标注其实际完成的行为,并将这些辅助任务与目标指令任务联合训练 VLA 策略。
HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。
QF3 是一种在线 off-policy 强化学习算法,通过流匹配加 critic 动作梯度训练流策略,梯度经流输出的一步预测反向传播,并只对接近回放动作的维度施加 critic 梯度。
研究提出一种从无分割点云中学习抓取目标定位的策略,部署在拖车式液压林业起重机上,由同一网络支持行为克隆(BC)与强化学习(RL)。仿真中 BC 可清理 100 堆 200 根原木中的 98 堆,BC→RL 提升负载稳定性。12 次现场试验中,BC 与 BC→RL 分别完成 93.8% 和 88.9% 的库存堆放,高于几何启发式的 80.4%。
GaugeBench 通过改写固定机械结构的物理等价约定(如关节轴方向、关节角零点和连杆命名顺序)来评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅剩 51.6,低于 98 个真正未见机器人的 1489.6。
BiGym 2.0 将 BiGym 适配到 Unitree G1,用统一全身控制器覆盖 20 项家务任务,并为每项任务提供 60 条人类 VR 演示,含同步多视角与全身执行记录。
MobileVISTA 是一种数据生成框架,通过联合增强自我中心视觉观测并重定向动作以补偿基座姿态变化,将标准姿态下的演示转化为多样化的姿态扰动训练数据。该框架针对相机随运动链移动且机器人占据大部分画面的自我中心平台(如人形机器人),在仿真任务和真实 Galaxea R1 Pro 上验证,无需额外采集演示或训练生成模型即可提升策略对分布外姿态的鲁棒性,且在人形机器人上收益最大。
研究者提出 OCBench,一个带可控脚本策略的机器人操作基准,其脚本策略具备与人类演示相似的关键特性,从而在受控环境中复现了行为克隆的多种反常现象,例如模型对数据过拟合越严重性能反而持续提升、无动作分块的完全闭环策略往往彻底失败。OCBench 依托 GPU 加速环境和脚本策略,可对以往报道的 BC 相关现象展开分析并证伪多种假设。
研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。
研究指出,JEPA 世界模型仅靠下一步预测加防坍缩正则,无法保证保留可控的不稳定模态,训练损失最小化时这些模态仍可能被坍缩。为此作者在世界模型训练中加入动作重建目标(逆动力学损失),并证明精确动作重建可使编码器在有限时域可达子空间上单射。在 CartPole、Walker2D 和 PointMaze 上的实验表明,该控制感知表示学习方法在非线性视觉控制任务中同样有效。
EVFormer 是一个融合当前 RGB 帧与之前 200 ms 双侧手腕 sEMG 的多模态框架,用于估计 44 个手指与手腕关节角度,通过顺序双向交叉注意力和特征级门控融合实现跨模态信息交互。
TAPDreamer 是一种针对世界动作模型的可迁移对抗补丁攻击,仅用公开编码器构造固定局部扰动,无需查询目标策略即可跨任务和动作架构迁移。
WAMJET 是一个智能体加速框架,通过为编码智能体配备可复用的优化指导与测量验证工具,加速 World Action Model(WAM)推理。它采用瓶颈驱动流程,让智能体分析推理、修改代码、验证效果并迭代优化加速栈,在六种 WAM、三种编码智能体和两种 GPU 架构上实现最高 9.95x 无损加速,近似与硬件感知优化还能进一步降低延迟且成功率相当。
研究者提出 Completion Aware Guidance(CAG),一种免训练采样方法,用于解决 World Action Models(WAMs)在短片段控制下出现的任务不完整想象问题。在代表性 WAMs 上,CAG 将 RoboTwin 2.0 子集成功率从 64% 提升至 70%,零样本仿真中从 69% 提升至 75%,并将任务不完整想象从 79% 降至 40%。
研究团队发布 FineART 双臂操作数据集,含 40,543 条轨迹(1,718 小时)、533,913 个子任务,覆盖 151 项任务,并推出可预测下一子任务的视觉-语言-动作策略 FineART-VLA。
研究者提出 Causal Semantic World Action Model(CSWAM),在 FastWAM 基础上引入基于 V-JEPA 2.1 的因果语义专家,通过因果注意力将历史语义上下文共享给视频与动作流,推理时仅需当前视频状态和语义历史即可完成动作去噪。
Guided Action Flow(GAF)通过从机器人任务 rollout 中学习紧凑的观测条件动作价值 critic,并用其动作梯度引导反向流采样,使监督微调后的 VLA 策略保持冻结。
研究者提出 Residual Latent Action(RLA),可从 DINO 残差中学习,并据此构建 RLA-WM 世界模型,通过 flow matching 预测 RLA 值。
SimToolReal 提出一种以物体为中心的 sim-to-real 强化学习策略,通过在仿真中程序化生成大量工具类物体并训练单一策略,实现测试时无需任何物体或任务特定训练即可完成灵巧工具操作。
LHM-Humanoid 提出一种无需重置的长时程人形运动控制方法,让物理仿真人形在单次连续运行中反复完成走向物体、全身平衡抬起、绕过障碍搬运并放置的完整循环。
针对冻结的 VLA 策略可能选中局部可行但断绝安全完成任务路径的动作,研究者提出"可行性-似然差距"概念,并推导出受限安全完成任务的历史条件轨迹律的精确下一块边缘分布,据此设计免训练重排序器 VICS-G。
Ego2World 是一个可执行基准,将第一视角烹饪视频转化为由图转移规则驱动的符号世界,基于 HD-EPIC 从视频标注中提取可复用转移规则。评估时模拟器维护隐藏世界图,智能体仅凭局部观察和执行反馈在自身部分信念图上规划,无法观测真实世界状态。实验显示动作重叠分数会高估物理状态成功率,而持久信念记忆能提升任务完成率并减少重复视觉探索。
DepthWorld 是首个基于 Stable Video Diffusion 的 3D 世界模型,通过空间 latent tiling 联合预测多视角 RGB 与深度,同时保持预训练 VAE 不变。