跳到正文
arXiv cs.AI· Mohamed Ayman Mohamed, Harshil Kotamreddy, Marcos Menon Jose·· 10 小时前AI 评分26

自参照社会偏好:不观察他人奖励也能学会合作

Self-Referenced Social Preferences: Cooperation without Observing Others Rewards

AI 导读

研究者提出"自参照社会偏好"方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测轨迹,从自身视角评估对方结果,再接入标准社会偏好机制。在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中,智能体无需观察他人奖励即可学会合作,甚至在独立学习失败的环境中也能实现合作,且收益分配常比能获取真实奖励的智能体更公平。

来源:arXiv cs.AI · arxiv.org