跳到正文
热点事件持续更新

M3SunAgent单目3D空间理解智能体论文发布

1 篇报道1 个报道来源9 小时前更新

先了解这件事

报道摘要

研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。

摘自 arXiv cs.CV

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.CV
    M3SunAgent:面向度量深度估计与3D视觉定位的单目3D空间理解智能体

    研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。