arXiv cs.CL· Shaokun Zhang, Yifan Zhang, Jian Hu, Yueying Li, Hao Zhang, Binfeng Xu, Jan Kautz, Yi Dong·· 4 小时前AI 评分29
LoGRA:用低秩梯度草图扩展 LLM 强化学习
LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
AI 导读
LoGRA 通过低秩梯度草图保留学习信号来降低 LLM 强化学习后训练的内存占用,并结合 predicted-KL 步长控制防止过大更新破坏训练。在推理任务上,LoGRA 平均降低训练内存最多 45.7% 且不损失性能,并能在单台八卡节点上稳定训练 27B 参数模型超过 1,100 步,而稠密 Adam 在此场景下会内存耗尽。代码已在 Molt 库中开源。
来源:arXiv cs.CL · arxiv.org