跳到正文
arXiv cs.LG· Tuan Duong Trinh, Basim Azam, Mohammed Ishaq Ansari, Mohammed Yaqoob Ansari, Naveed Akhtar·· 3 小时前AI 评分30

推理链可作为视觉-语言-动作策略的控制面:DeepThinkVLA 在 LIBERO-Goal 上的反事实干预研究

Altered Thoughts, Altered Actions: Reasoning Chain as Control Surface for a Vision-Language-Action Policy

AI 导读

研究用确定性实体替换对 DeepThinkVLA 的指令与推理链做双向干预,发现推理链是有效的控制面:在 LIBERO-Goal 上,用干净指令生成的推理链替换被污染指令的推理链,可挽回 47.8 pp 的成功率,但距干净运行仍差 38.0 pp,高于预注册预测的 5-15 pp。全部 10 个任务均朝预测方向变化,说明写入推理链的文本能修复也能破坏机器人行为。

来源:arXiv cs.LG · arxiv.org