arXiv cs.AI· Mohamed Ayman Mohamed, Harshil Kotamreddy, Marcos Menon Jose·· 10 小时前AI 评分26
自参照社会偏好:不观察他人奖励也能学会合作
Self-Referenced Social Preferences: Cooperation without Observing Others Rewards
AI 导读
研究者提出"自参照社会偏好"方法,让每个智能体学习自身奖励模型,并将其应用于其他智能体的观测轨迹,从自身视角评估对方结果,再接入标准社会偏好机制。在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中,智能体无需观察他人奖励即可学会合作,甚至在独立学习失败的环境中也能实现合作,且收益分配常比能获取真实奖励的智能体更公平。
来源:arXiv cs.AI · arxiv.org