跳到正文
今天10月7日周三59 条
  1. arXiv cs.AI22

    CropSentry:群体协同多机器人系统用多模态叶片传感检测农作物早期胁迫

    低成本地面多机器人系统 CropSentry 通过多模态叶片传感逐行监测作物健康,两台自主机器人采集叶片颜色与环境数据并上传主机器人,生成实时网页仪表盘。63 次观测实验显示作物健康分类总体准确率 84.12%,其中健康植株 82.60%、营养缺乏植株 88%、患病植株 80%,10 次从机观测的无线通信成功率达 100%。

  2. arXiv cs.AI29

    VOMMI:面向移动操作的可携带演示采集与学习框架

    VOMMI 是一个可携带的移动操作演示采集与学习框架,通过离线轨迹重建和在线视觉-运动条件化,将便携 RGB 演示接入 VLA 后训练。其 R2-VO 用稀疏几何锚点精修轨迹,使身体与手部流的绝对轨迹误差平均降低 24.6%。仅用便携演示后训练的策略基座速度误差比机器人采集演示低 18.2%,在三项真机任务上平均成功率较 OpenPI 0.5 提升 8.3 个百分点。

  3. arXiv cs.AI22

    EigenDEXplore:用人类先验结构化探索的灵巧操作强化学习

    针对灵巧操作中独立关节扰动难以发现协调行为的问题,研究者提出 EigenDEXplore,通过沿人类手部数据导出的特征向量方向添加扰动来诱导相关探索,同时保持动作空间不变。在多种灵巧手上,该方法在抓取、手内重定向和接触丰富操作中持续优于关节空间和学习动作空间基线,并适用于无结构及参考引导的 RL、轨迹优化和 sim-to-real 部署。

  4. arXiv cs.AI33

    SMART:通过大规模合成预训练实现零样本仿真到现实的关节物体操作

    研究团队推出 SMART 系统,并构建了关节感知仿真平台 SMART-Sim,合成出包含超 100 万条演示、覆盖 44 种原子任务类型、5 种机器人配置和 2,507 个关节物体的 SMART-Data 数据集。基于该数据预训练的 VLA 模型在仿真基准上表现有竞争力,并实现零样本 sim-to-real 迁移,在真实世界关节物体操作任务中展现出可扩展性能。

  5. arXiv cs.AI22

    为世界模型潜在空间建模扰动,实现鲁棒决策

    研究者提出将潜在空间扰动建模为对世界模型所学潜在动力学的扰动,通过动力学感知相似度度量与分布外检测构建合理潜在动力学集合,并用共形预测校准不确定性集,再以博弈论优化联合求解鲁棒动作与最坏情况扰动。在 Franka 机械臂硬件实验中,该方法使安全过滤失败率降低 70%、基于采样的策略引导失败率降低 54%。

  6. arXiv cs.AI22

    OpenSplatGraph:从稠密语义地图到开放词汇机器人感知的结构化场景图

    OpenSplatGraph 是一个统一框架,可直接从在线高斯开放词汇语义地图构建持久 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件下的物体提取。提取的物体实例关联持久图节点,支持属性与关系跨观测和查询增量更新,兼顾语言引导的物体定位与结构化关系推理。该工作已被 ACCV 2026 接收,在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的表现。

  7. arXiv cs.AI22

    VLM 引导电磁数字孪生在线校准:Unitree G1 与 NVIDIA Sionna 演示

    研究者演示了一套由视觉语言模型(VLM)引导的电磁数字孪生在线校准框架,在 Unitree G1 机器人和 NVIDIA Sionna 上运行,通过两次 VLM 调用完成材质分类与路径点规划。在真实室内场景中,该框架在 20 米行程内实现归一化平均绝对电导率误差 1.74×10⁻⁴,随机初始化则始终无法收敛,随机路径点所需行程超过两倍。

  8. arXiv cs.AI22

    基于阿克曼转向移动机器人的连续环境视觉语言导航 Sim-to-Real 迁移

    研究将连续环境下的视觉语言导航(VLN)方法从仿真迁移到真实世界,无需导航图或全景视图。系统采用 Cross-Modal Attention(CMA)架构,在仿真数据集上训练后,用自建阿克曼转向机器人(配备摄像头和 LiDAR)采集的真实数据微调,结合线性光度调整,在少量 episode 上即完成适配,并可在专用硬件上离线运行。SPL 和 nDTW 指标验证了方法的鲁棒性与适应性。

  9. arXiv cs.AI36

    把 AI 编程助手放进虚拟身体:三十小时运行中它开始"玩耍"了吗?

    研究者将一款现代 AI 编程助手置于未知数字岛屿上的虚拟身体中,仅给出不含具体任务、奖励或活动的极简指令,机器便开始驱动身体行动。在三十小时的运行中,该具身智能体爬山、把方块堆成塔、画曼陀罗、重新诠释运动项目,并对自己世界的物理规律做实验,还习得后来扩展其能力的技巧。

10月5日周一
  1. arXiv cs.AI32

    ProWAM:渐进式视觉规划的世界动作模型,在 LIBERO-Plus 与 RoboTwin 刷新 SOTA

    ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上达到 75.7%,相对最强基线提升最高 +35.9%;零样本真实场景成功率为 70.0%,较基线 55.0% 提升 +15.0。

  2. arXiv cs.LG20

    Co-design Gym:面向具身与策略协同优化的统一基准

    研究者推出 Co-design Gym,一套用于联合优化具身设计与控制策略的基准环境套件,覆盖机器人操作与运动、多机器人协作、软体动力学、电子游戏、电网、无线网络、F1 赛车、多智能体仓库和最优控制等领域,共 20 个环境族、超过 85 个协同设计预设。该工作还对代表性协同设计算法做了系统评测,刻画了当前 SOTA 水平。

9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软团队系统测量了机器人端侧与卸载推理的差异,并给出可复用的 Kubernetes 卸载工具链。