arXiv cs.CV· Jinsong Zhang, Kejun Wu, Ming Zhu, Renjie Qiao, Chengtao Cai, Zhengguo Li·· 8 小时前AI 评分22
M3SunAgent:面向度量深度估计与3D视觉定位的单目3D空间理解智能体
M3SunAgent: Monocular 3D Spatial Understanding Agent for Metric Depth Estimation and 3D Visual Grounding
AI 导读
研究者提出统一智能体 M3SunAgent,用 LLM 作为任务规划器进行空间视觉编程,将单目度量深度估计与3D视觉定位两个任务整合到同一框架。在实例级深度估计评测中,52.61% 的预测实例深度误差低于 0.25(δ<0.25),为所有对比模型中最佳;3D视觉定位取得 41.73% 的 3D mIoU,超过 SOTA 模型 MonoVLM 3.62%。
来源:arXiv cs.CV · arxiv.org