跳到正文
arXiv cs.LG· Mark Braverman, Jingyi Liu, Jieming Mao, Jon Schneider, Eric Xue·· 3 小时前AI 评分17

预算约束在线学习新算法实现近最优 regret 界

Optimally Pacing Budget Spending and Learning

AI 导读

研究者针对对抗场景下预算约束在线学习问题,提出一种全信息算法,在任意 F 个预算节奏专家类上取得 O(D√log F + √T log F) 的 regret 界,与 Braverman 等人(2025)的下界匹配。该技术还扩展到在线资源分配问题,在允许分数分配时实现 O(D√log F) 的 regret 界,是首个在此类任务上达到 o(√T) 保证的算法。

来源:arXiv cs.LG · arxiv.org