跳到正文
arXiv cs.LG· Tianruo Rose Xu, Jiawei Ren, Yichi Yang, Zhaoxu Zheng, Lianhui Qin·· 6 小时前AI 评分41

RT-Safe:实时具身环境中的智能体安全基准测试

RT-Safe: Benchmarking Agent Safety in Real-Time Embodied Environment

AI 导读

研究者推出 RT-SAFE,一个模拟城市基准,用于评估实时约束下的具身智能体安全。在八个 VLM 上,最难设置中仅 0.7% 的回合无安全事件完成;静态与实时评测任务完成率分别为 91.3% 和 94.1%,但实时执行使碰撞增加 12.3 倍。RT-SAFE 还可支持离线 RL 训练,在保持高任务完成率的同时大幅降低碰撞率。

来源:arXiv cs.LG · arxiv.org