跳到正文
arXiv stat.ML· Akira Kitaoka·· 4 小时前AI 评分22

Outperformance 逆优化:学习能超越智能体决策的目标函数

Outperformance Inverse Optimization: Learning Objective Functions that Outperform Agent Decisions

AI 导读

研究者提出 outperformance 逆优化,不再拟合观测决策本身,而是寻找在每个状态下都能在各分量上超越观测动作的最优解权重。该方法给出仅依赖前向问题 oracle 即可评估的损失函数,适用于 MILP,并配套基于梯度和 DC 优化的算法;在权重于所有观测上诱导唯一超越最优解时,其泛化误差上界与观测数量成反比,且该上界在观测数量上紧至对数因子。

来源:arXiv stat.ML · arxiv.org