arXiv cs.CV· Xingtai Gui, Yucheng Zhou, Dongqian Guo, Jiahao Gong, Feiyang Tan, Jianbing Shen·· 4 小时前AI 评分22
GeoCoTDrive:面向自动驾驶 VLA 的显式几何链式推理框架
Explicit Geometric Chain-of-Thought for Vision-Language-Action in Autonomous Driving
AI 导读
针对 VLA 模型在自动驾驶中"动作需精确 3D 几何线索、而视觉语言推理停留在 2D 语义空间"的错配,研究者提出显式几何链式推理框架 GeoCoTDrive,先定位决策关键的 2D 区域,再从几何基础模型采样局部 3D 先验并交织进自回归上下文以生成轨迹。
来源:arXiv cs.CV · arxiv.org