arXiv cs.LG· Fernando Martinez, Tao Li, Yingdong Lu, Juntao Chen·· 9 小时前AI 评分22
CASTLE:基于反事实语义-社会世界模型的独立多智能体强化学习
Independent Multi-Agent Reinforcement Learning with Counterfactual Semantic-Social World Models
AI 导读
CASTLE 是一个面向完全去中心化多智能体强化学习(独立学习)的离线训练、在线上下文引导框架,包含局部动力学世界模型和语义-社会世界模型,二者冻结后仅凭局部信息为独立 PPO 策略提供预测 logits 引导。在 Tag、Spread、Adversary 三个多粒子环境各 30 个匹配种子上,CASTLE 取得最高平均最终得分,分别超出最强基线 10.67、6.46 和 0.33 归一化分。
来源:arXiv cs.LG · arxiv.org