跳到正文
arXiv stat.ML· Avishek Ghosh·· 11 小时前AI 评分17

多臂老虎机中的 Nash 社会福利:轨迹级期望与高概率遗憾

Nash Social Welfare for Multi Armed Bandits: Trajectory-wise Expected and High Probability Regret

AI 导读

研究针对以累积奖励几何平均衡量的 Nash 社会福利(NSW)目标,提出轨迹级 Nash 遗憾,先对完整样本路径取几何平均再求期望,比原有指标更严格。同时给出首个高概率 Nash 遗憾界,其两阶段算法 RR-NCB 结合轮询探索与 Nash 置信界索引策略,达到 Õ(√(k/T)) 的最优速率。该工作已被 NeurIPS 2026 接收。

来源:arXiv stat.ML · arxiv.org