跳到正文
arXiv cs.CV· Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy·· 4 小时前AI 评分26

StressDream:引导视频世界模型实现鲁棒策略评估与改进

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

AI 导读

StressDream 通过优化扩散式视频世界模型的初始噪声,将想象引导至推理时以文本指定的高影响但合理的结果,如任务失败。该方法结合 VLM 语义目标与合理性目标,避免噪声漂移到 OOD 分布。在自动驾驶与机器人操作的 SOTA 视频世界模型上,StressDream 能识别其合理未来包含不良后果的动作,从而实现鲁棒策略评估与改进。

来源:arXiv cs.CV · arxiv.org