跳到正文
arXiv cs.AI· Guanqun Zhao, Zijun Xie, Binbin Zheng, Yehan Yang, Jiafeng Lu, Aoqi Hu, Enlei Gong, Zeyu Chen·· 3 小时前AI 评分27

ENTR:面向异步强化学习的熵归一化信任域方法

Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning

AI 导读

针对异步强化学习中陈旧 off-policy 数据导致优化不稳的问题,研究者提出熵归一化信任域方法 ENTR,指出 ratio 的自然尺度由 token 熵决定,并识别出低熵区间会放大训练-推理失配噪声。

来源:arXiv cs.AI · arxiv.org