跳到正文
arXiv stat.ML· Yannis Montreuil, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi·· 10 小时前AI 评分15

ORUCB:在线延迟决策中学习修正专家答案

A Query Is Not a Commitment: Learning to Correct Expert Answers in Online Deferral

AI 导读

研究者提出 ORUCB,在在线学习延迟(online learning to defer)场景中,让学习器在购买专家答案前先固定一个修正函数,再对收到的答案应用该函数。该方法通过池化共享与专家专属的多项式响应,在固定问题参数下实现高概率伪遗憾 O(√T log(T+1))。在四个测试流上,所选三次策略的费用包含成本低于七个直接使用原始答案的基线。

来源:arXiv stat.ML · arxiv.org