跳到正文
热点事件持续更新

研究测量推理链对VLA策略动作的控制作用

1 篇报道1 个报道来源2 小时前更新

先了解这件事

报道摘要

研究用确定性实体替换对 DeepThinkVLA 的指令与推理链做双向干预,发现推理链是有效的控制面:在 LIBERO-Goal 上,用干净指令生成的推理链替换被污染指令的推理链,可挽回 47.8 pp 的成功率,但距干净运行仍差 38.0 pp,高于预注册预测的 5-15 pp。全部 10 个任务均朝预测方向变化,说明写入推理链的文本能修复也能破坏机器人行为。

摘自 arXiv cs.LG

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.LG
    推理链可作为视觉-语言-动作策略的控制面:DeepThinkVLA 在 LIBERO-Goal 上的反事实干预研究

    研究用确定性实体替换对 DeepThinkVLA 的指令与推理链做双向干预,发现推理链是有效的控制面:在 LIBERO-Goal 上,用干净指令生成的推理链替换被污染指令的推理链,可挽回 47.8 pp 的成功率,但距干净运行仍差 38.0 pp,高于预注册预测的 5-15 pp。全部 10 个任务均朝预测方向变化,说明写入推理链的文本能修复也能破坏机器人行为。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。