arXiv cs.LG· Michael Tang, Mahmoud Abdelgalil, Jorge I. Poveda·· 6 小时前AI 评分16
欺骗性 Bandit 问题:探索耦合与多智能体学习的脆弱性
The Deceptive Bandit Problem: Exploratory Coupling and the Fragility of Multi-Agent Learning
AI 导读
研究揭示,对抗性智能体可利用另一智能体探索过程的泄露信号,通过将自身探索动作与这些信息耦合,把学习动态引导至新稳态"欺骗性纳什均衡(DNE)"。作者证明欺骗性 bandit 学习(DBL)动态能以最优收敛速率收敛到 DNE 的任意小邻域,并在放宽标准 bandit 优化文献二阶平滑条件下仍保持该速率。研究刻画了欺骗严格改变稳态的条件及其对欺骗者成本的影响,并在资源分配博弈中进行了展示。
来源:arXiv cs.LG · arxiv.org