LoGRA低秩梯度草图降低RL训练内存
热点事件持续更新
LoGRA低秩梯度草图降低RL训练内存
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Shaokun Zhang等作者提出并发布LoGRA,一种用于大语言模型强化学习后训练的方法。它通过低秩梯度草图保留学习信号来降低内存占用,并结合predicted-KL步长控制防止过大更新破坏训练。 作者称,在推理任务上LoGRA平均降低训练内存最多45.7%且不损失性能;在单台八卡节点上可稳定训练27B参数模型超过1,100步,而稠密Adam在此场景下会内存耗尽。代码已在Molt库中开源。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
LoGRA:用低秩梯度草图扩展 LLM 强化学习报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CLLoGRA:用低秩梯度草图扩展 LLM 强化学习
LoGRA 通过低秩梯度草图保留学习信号来降低 LLM 强化学习后训练的内存占用,并结合 predicted-KL 步长控制防止过大更新破坏训练。在推理任务上,LoGRA 平均降低训练内存最多 45.7% 且不损失性能,并能在单台八卡节点上稳定训练 27B 参数模型超过 1,100 步,而稠密 Adam 在此场景下会内存耗尽。代码已在 Molt 库中开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。