跳到正文
今天10月7日周三59 条
  1. arXiv cs.CV22

    HRDexDB:跨人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 是一个真实世界 4D 灵巧抓取数据集,覆盖五种本体、100 个物体、3.2K 次试验,记录 3D 手-物交互轨迹随时间的变化。它通过同步多相机系统和重建流程提供多视角与第一视角 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹及成功/失败标注。该数据集已用于人到机器人接触图迁移、视觉机器人-物体接触估计和检索辅助抓取。

  2. arXiv cs.CV30

    ROMA:面向真实世界物体中心多感官主动感知的 LLM 系统

    ROMA 是一个基于 LLM 的真实世界物体中心多感官主动感知系统,融合视觉、音频、触觉与力觉,通过推理-交互-反馈闭环主动获取缺失证据。研究团队构建了覆盖近 2,000 个物体、6 种原子交互的 ROMI-2K 数据集,并采用两阶段训练框架对齐多感官模态,同时提出 ROMA Bench 评估单属性、长程多属性与意图驱动的主动感知。实验显示 ROMA 能完成现有方法难以处理的长链多感官感知任务。

  3. arXiv cs.CV22

    M3SunAgent:面向度量深度估计与3D视觉定位的单目3D空间理解智能体

    研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。

  4. arXiv cs.CV22

    R2RI:面向机器人间交互的多视角事件与 RGB 数据集

    研究者发布首个专为机器人间交互(RRI)任务设计的数据集 R2RI,包含多款人形机器人和模拟真实人类社交行为的交互场景。数据集提供每个机器人机载传感器的第一视角与外部固定相机的第三视角,共含超 650 万帧、约 5000 段 120 fps 视频,覆盖 Event 与 RGB 两种模态。数据集及全部任务与模态标注已公开。

  5. arXiv cs.LG22

    基于自回归扩散的3D场景图高层概念生成

    研究提出一种统一的自回归扩散图生成模型,联合学习结构与特征,从观测到的垂直平面自底向上构建任意层级深度的完整3D场景图(3DSG)。该方法在合成场景、真实建筑平面图和机器人传感器数据等3DSG数据集上持续超越所有基于学习和随机的基线,并在最大层级和真实单层数据上超越可获取目标图尺寸的one-shot模型。

  6. arXiv cs.LG22

    奖励即观测:学习基于奖励的策略以实现快速适应

    研究者提出一种仅以奖励和动作为条件的奖励策略,可在观测空间完全不同的源环境与目标环境之间实现零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练后,可零样本迁移到不同配色、3D 渲染以及 Habitat-Sim 中的 Stretch 机器人导航任务。基于奖励的策略还能进一步引导目标环境中基于观测的策略训练。

  7. arXiv cs.LG31

    HARL-A:基于 IsaacLab 的可扩展异构多智能体对抗强化学习基准框架

    HARL-A 是一个基于 IsaacLab 构建的开源异构多智能体对抗强化学习基准框架,支持任意数量队伍及每队任意机器人形态组合的对抗策略训练与评测。该框架扩展了 HARL 算法库与 IsaacLab,提供模块化架构、Sumo/Soccer/3D Galaga 三个基准环境,以及十余个覆盖同构与异构队伍配置的预训练策略,已公开于 Hugging Face。代码、环境、策略与文档均已开放获取。

  8. arXiv cs.LG22

    液压起重机原木堆清理:从点云学习抓取目标定位

    研究提出一种从无分割点云中学习抓取目标定位的策略,部署在拖车式液压林业起重机上,由同一网络支持行为克隆(BC)与强化学习(RL)。仿真中 BC 可清理 100 堆 200 根原木中的 98 堆,BC→RL 提升负载稳定性。12 次现场试验中,BC 与 BC→RL 分别完成 93.8% 和 88.9% 的库存堆放,高于几何启发式的 80.4%。

  9. arXiv cs.LG31

    MobileVISTA:面向移动操作姿态泛化的生成式数据增强框架

    MobileVISTA 是一种数据生成框架,通过联合增强自我中心视觉观测并重定向动作以补偿基座姿态变化,将标准姿态下的演示转化为多样化的姿态扰动训练数据。该框架针对相机随运动链移动且机器人占据大部分画面的自我中心平台(如人形机器人),在仿真任务和真实 Galaxea R1 Pro 上验证,无需额外采集演示或训练生成模型即可提升策略对分布外姿态的鲁棒性,且在人形机器人上收益最大。

  10. arXiv cs.LG22

    OCBench:可复现行为克隆谜题的机器人操作基准

    研究者提出 OCBench,一个带可控脚本策略的机器人操作基准,其脚本策略具备与人类演示相似的关键特性,从而在受控环境中复现了行为克隆的多种反常现象,例如模型对数据过拟合越严重性能反而持续提升、无动作分块的完全闭环策略往往彻底失败。OCBench 依托 GPU 加速环境和脚本策略,可对以往报道的 BC 相关现象展开分析并证伪多种假设。

  11. arXiv cs.LG22

    重新审视深度强化学习中的时间正则化:CATS 实现平滑控制

    研究者重新审视了深度强化学习中时间正则化无法提供空间平滑性的假设,证明时间惩罚项能约束共享同一后继状态的当前状态间的期望动作差异,并据此提出 CATS 方法,将时间惩罚与线性递增结合。仿真和真实世界实验显示,CATS 在不降低任务性能的前提下大幅减少动作振荡,计算开销极小。

  12. arXiv cs.LG22

    JEPA 世界模型如何用逆动力学保留不稳定模态

    研究指出,JEPA 世界模型仅靠下一步预测加防坍缩正则,无法保证保留可控的不稳定模态,训练损失最小化时这些模态仍可能被坍缩。为此作者在世界模型训练中加入动作重建目标(逆动力学损失),并证明精确动作重建可使编码器在有限时域可达子空间上单射。在 CartPole、Walker2D 和 PointMaze 上的实验表明,该控制感知表示学习方法在非线性视觉控制任务中同样有效。

  13. arXiv cs.AI33

    WAMJET:面向 World Action Model 的智能体加速框架

    WAMJET 是一个智能体加速框架,通过为编码智能体配备可复用的优化指导与测量验证工具,加速 World Action Model(WAM)推理。它采用瓶颈驱动流程,让智能体分析推理、修改代码、验证效果并迭代优化加速栈,在六种 WAM、三种编码智能体和两种 GPU 架构上实现最高 9.95x 无损加速,近似与硬件感知优化还能进一步降低延迟且成功率相当。

  14. arXiv cs.AI22

    面向世界动作模型的完成感知引导(CAG)

    研究者提出 Completion Aware Guidance(CAG),一种免训练采样方法,用于解决 World Action Models(WAMs)在短片段控制下出现的任务不完整想象问题。在代表性 WAMs 上,CAG 将 RoboTwin 2.0 子集成功率从 64% 提升至 70%,零样本仿真中从 69% 提升至 75%,并将任务不完整想象从 79% 降至 40%。

  15. arXiv cs.AI12

    Ego2World:将第一视角烹饪视频编译为可执行世界以进行信念状态规划

    Ego2World 是一个可执行基准,将第一视角烹饪视频转化为由图转移规则驱动的符号世界,基于 HD-EPIC 从视频标注中提取可复用转移规则。评估时模拟器维护隐藏世界图,智能体仅凭局部观察和执行反馈在自身部分信念图上规划,无法观测真实世界状态。实验显示动作重叠分数会高估物理状态成功率,而持久信念记忆能提升任务完成率并减少重复视觉探索。

  16. arXiv cs.AI29

    EgoLAP:通过语言-动作推理从第一人称人类数据中学习

    EgoLAP 是一个 VLA 预训练框架,通过共享的基于语言的动作链式推理,联合学习人类与机器人轨迹,将动作意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的平均真实任务进度,相比替代动作表示取得 2.3 倍性能提升,且运动级推理优于结合子任务、物体框与视觉轨迹的复合推理格式。