EgoLAP:通过语言-动作推理从第一人称人类数据中学习
EgoLAP 是一个 VLA 预训练框架,通过共享的基于语言的动作链式推理,联合学习人类与机器人轨迹,将动作意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的平均真实任务进度,相比替代动作表示取得 2.3 倍性能提升,且运动级推理优于结合子任务、物体框与视觉轨迹的复合推理格式。
EgoLAP 是一个 VLA 预训练框架,通过共享的基于语言的动作链式推理,联合学习人类与机器人轨迹,将动作意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的平均真实任务进度,相比替代动作表示取得 2.3 倍性能提升,且运动级推理优于结合子任务、物体框与视觉轨迹的复合推理格式。
研究者推出 HygieneRoboBench,包含 134 个任务族、624 个实例,用于评估规划器如何依据执行历史识别接触污染风险并规划安全后续动作。评测显示,基于 LLM 与符号规划的基线能安全完成任务,却未必在用户优先级下实现最低执行成本。
低成本地面多机器人系统 CropSentry 通过多模态叶片传感逐行监测作物健康,两台自主机器人采集叶片颜色与环境数据并上传主机器人,生成实时网页仪表盘。63 次观测实验显示作物健康分类总体准确率 84.12%,其中健康植株 82.60%、营养缺乏植株 88%、患病植株 80%,10 次从机观测的无线通信成功率达 100%。
研究提出 Micro Neural Policies(MNP),将 Evolution Strategy 与基于 Statistical Model Checking 的验证结合用于策略搜索,大幅压缩神经网络规模。
VOMMI 是一个可携带的移动操作演示采集与学习框架,通过离线轨迹重建和在线视觉-运动条件化,将便携 RGB 演示接入 VLA 后训练。其 R2-VO 用稀疏几何锚点精修轨迹,使身体与手部流的绝对轨迹误差平均降低 24.6%。仅用便携演示后训练的策略基座速度误差比机器人采集演示低 18.2%,在三项真机任务上平均成功率较 OpenPI 0.5 提升 8.3 个百分点。
研究者提出 CoRP(Compressed Representation Policy),一个仅 48.9M 参数、不含视觉语言模型和视频生成先验的紧凑策略,在 LIBERO 上达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 上达到 75.78%/73.36%,匹配比它大 40.9-163.6 倍的系统。
研究者提出自监督测试时自适应方法 SALT,利用上一动作块中未执行的"剩余轨迹"作为监督信号,在视觉干扰发生时更新 VLA 策略,并通过 Transition Anchoring 与 Sequential Correction Propagation 将修正沿执行轨迹传递。
针对灵巧操作中独立关节扰动难以发现协调行为的问题,研究者提出 EigenDEXplore,通过沿人类手部数据导出的特征向量方向添加扰动来诱导相关探索,同时保持动作空间不变。在多种灵巧手上,该方法在抓取、手内重定向和接触丰富操作中持续优于关节空间和学习动作空间基线,并适用于无结构及参考引导的 RL、轨迹优化和 sim-to-real 部署。
研究团队推出 SMART 系统,并构建了关节感知仿真平台 SMART-Sim,合成出包含超 100 万条演示、覆盖 44 种原子任务类型、5 种机器人配置和 2,507 个关节物体的 SMART-Data 数据集。基于该数据预训练的 VLA 模型在仿真基准上表现有竞争力,并实现零样本 sim-to-real 迁移,在真实世界关节物体操作任务中展现出可扩展性能。
研究者提出将潜在空间扰动建模为对世界模型所学潜在动力学的扰动,通过动力学感知相似度度量与分布外检测构建合理潜在动力学集合,并用共形预测校准不确定性集,再以博弈论优化联合求解鲁棒动作与最坏情况扰动。在 Franka 机械臂硬件实验中,该方法使安全过滤失败率降低 70%、基于采样的策略引导失败率降低 54%。
OpenSplatGraph 是一个统一框架,可直接从在线高斯开放词汇语义地图构建持久 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件下的物体提取。提取的物体实例关联持久图节点,支持属性与关系跨观测和查询增量更新,兼顾语言引导的物体定位与结构化关系推理。该工作已被 ACCV 2026 接收,在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的表现。
研究者提出 Physics-Guided Visual Prompting(PG-VP),一种即插即用多模态感知模块,让冻结的 VLA 模型通过叠加随帧移动的虚拟障碍物绕开 RGB 相机不可见的辐射与热源,无需重新训练。
RoboCap 是一个 250g、六摄像头、双 IMU 的帽子式设备,用于在真实环境中采集第一人称操作数据,配套的 Grounded API 提供与设备无关的 3D 算法。该平台在公开基准上取得 SOTA 表现,涵盖多场景 SLAM、第一人称深度估计,以及适配第三方设备的手部追踪。
研究者演示了一套由视觉语言模型(VLM)引导的电磁数字孪生在线校准框架,在 Unitree G1 机器人和 NVIDIA Sionna 上运行,通过两次 VLM 调用完成材质分类与路径点规划。在真实室内场景中,该框架在 20 米行程内实现归一化平均绝对电导率误差 1.74×10⁻⁴,随机初始化则始终无法收敛,随机路径点所需行程超过两倍。
VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的协同进化来扩展验证能力。
AssemState 是一个零样本家具装配框架,通过锚点引导的边界装配状态将手册页面分解为单部件操作并恢复装配树,再用迭代后状态反馈精修引导 SE(3) 位姿更新与修正,并通过仿真释放测试验证物理合理性。
研究者提出 EMHO,一种在具身模型冻结的前提下,通过分析执行轨迹与历史 Harness 记录来自我迭代优化 Harness 的框架,并配套 EMHO-Merge 以用单套 Harness 支持多子任务。在 EmbodiedBench 的导航与操作任务上,EMHO 持续提升 Qwen 9B 和 27B 的任务成功率。
针对长时程具身任务中目标不在视野内、状态随前序任务改变的问题,研究者提出 Attacca,用与执行环境解耦的目标图像训练视觉目标条件策略,并通过上下文解耦目标采样、目标掩码预测头和 Search/Approach/Interact 行为阶段条件化来学习当前视角的密集定位。
研究将连续环境下的视觉语言导航(VLN)方法从仿真迁移到真实世界,无需导航图或全景视图。系统采用 Cross-Modal Attention(CMA)架构,在仿真数据集上训练后,用自建阿克曼转向机器人(配备摄像头和 LiDAR)采集的真实数据微调,结合线性光度调整,在少量 episode 上即完成适配,并可在专用硬件上离线运行。SPL 和 nDTW 指标验证了方法的鲁棒性与适应性。
研究者将一款现代 AI 编程助手置于未知数字岛屿上的虚拟身体中,仅给出不含具体任务、奖励或活动的极简指令,机器便开始驱动身体行动。在三十小时的运行中,该具身智能体爬山、把方块堆成塔、画曼陀罗、重新诠释运动项目,并对自己世界的物理规律做实验,还习得后来扩展其能力的技巧。
Reka AI 发布 190 亿参数全能模型 Rho-1 的研究预览版,可在单一神经网络中处理并生成文本、图像、视频和机器人控制动作。与多数把任务分派给专用模型的系统不同,Rho-1 将所有模态作为 token 放在同一上下文窗口中,无需工具调用或外部模型。
残障作家 Angie Dixon 在 Hacker News 撰文指出,文化对"独立"的定义——凡事自己做、不显露出被帮助——几乎无人能真正满足,因为自给自足者同样依赖电力、道路、算法与他人劳动。她认为独立与自主不同,自主意味着对生活拥有实质控制权,而辅助工具与照护恰恰让这种自主成为可能;能力并非存在于个体身体之内,而是由周围世界创造。
卡内基梅隆大学 Safe AI 实验室主任 Ding Zhao 联合创立 Safeworld,用搭载真实人体模型的仿真环境评估生成式 AI 驱动的机器人控制系统。
当工厂里机器人从几十台增至几百台,生产能力并不会自动翻倍,核心问题从"单台机器人能做什么"变成"如何把分散能力组织成整体"。文章提出AI负责理解与判断、系统负责组织与调度、机器人负责落地执行,三者连接才构成完整的机器生产能力,系统让机器人围绕同一生产目标形成可运行的整体。
CHASE-VLA 是一种面向 VLA 模型的 chunk 感知训练后量化(PTQ)方法,利用策略生成的动作 chunk 作为因果上下文,结合去噪步分组信息自适应调整动作专家(AE)的激活缩放,无需修改预训练策略即可实现 AE 中 MLP 与注意力投影的 W4A4 量化。
研究团队提出 VLA 推理框架 IG-VLA,让模型在视觉表征空间中想象任务相关的未来场景演变,并通过 Scene Gist Memory 将推理结果内化为紧凑的 Scene Gist Token,从而在推理时跳过显式未来想象。
ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上达到 75.7%,相对最强基线提升最高 +35.9%;零样本真实场景成功率为 70.0%,较基线 55.0% 提升 +15.0。
研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中回顾,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并在收购 SceniX 后推进机器人仿真能力。
推荐理由:AMD 收购 World Labs 的价格与 Atlas 在稀疏重建上的定位,能帮读者理解空间智能赛道的整合逻辑。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。