arXiv cs.AI· Guanqun Zhao, Zijun Xie, Binbin Zheng, Yehan Yang, Jiafeng Lu, Aoqi Hu, Enlei Gong, Zeyu Chen·· 3 小时前AI 评分27
ENTR:面向异步强化学习的熵归一化信任域方法
Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning
AI 导读
针对异步强化学习中陈旧 off-policy 数据导致优化不稳的问题,研究者提出熵归一化信任域方法 ENTR,指出 ratio 的自然尺度由 token 熵决定,并识别出低熵区间会放大训练-推理失配噪声。
来源:arXiv cs.AI · arxiv.org