研究测量推理链对VLA策略动作的控制作用
热点事件持续更新
研究测量推理链对VLA策略动作的控制作用
1 篇报道1 个报道来源2 小时前更新
先了解这件事
报道摘要
研究用确定性实体替换对 DeepThinkVLA 的指令与推理链做双向干预,发现推理链是有效的控制面:在 LIBERO-Goal 上,用干净指令生成的推理链替换被污染指令的推理链,可挽回 47.8 pp 的成功率,但距干净运行仍差 38.0 pp,高于预注册预测的 5-15 pp。全部 10 个任务均朝预测方向变化,说明写入推理链的文本能修复也能破坏机器人行为。
摘自 arXiv cs.LG
最新进展10月9日 12:00
推理链可作为视觉-语言-动作策略的控制面:DeepThinkVLA 在 LIBERO-Goal 上的反事实干预研究报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.LG推理链可作为视觉-语言-动作策略的控制面:DeepThinkVLA 在 LIBERO-Goal 上的反事实干预研究
研究用确定性实体替换对 DeepThinkVLA 的指令与推理链做双向干预,发现推理链是有效的控制面:在 LIBERO-Goal 上,用干净指令生成的推理链替换被污染指令的推理链,可挽回 47.8 pp 的成功率,但距干净运行仍差 38.0 pp,高于预注册预测的 5-15 pp。全部 10 个任务均朝预测方向变化,说明写入推理链的文本能修复也能破坏机器人行为。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。