跳到正文
arXiv stat.ML· Ian Osband·· 1 天前AI 评分22

从交叉熵到精确策略梯度:Ian Osband 提出 horizon loss 提升分类精度

Planning to Learn

AI 导读

Ian Osband 提出 horizon loss,将交叉熵视为"耐心的准确率",并按剩余训练量截断,从而在训练后期向精确策略梯度过渡。在 MNIST 及 ImageNet 上使用 ResNet-50、ResNet-101 和 ViT-S/16 测试,该方法在固定学习率下提升 top-1 准确率,且标签噪声越大增益越明显。

来源:arXiv stat.ML · arxiv.org