跳到正文
热点事件持续更新

LoGRA低秩梯度草图降低RL训练内存

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Shaokun Zhang等作者提出并发布LoGRA,一种用于大语言模型强化学习后训练的方法。它通过低秩梯度草图保留学习信号来降低内存占用,并结合predicted-KL步长控制防止过大更新破坏训练。 作者称,在推理任务上LoGRA平均降低训练内存最多45.7%且不损失性能;在单台八卡节点上可稳定训练27B参数模型超过1,100步,而稠密Adam在此场景下会内存耗尽。代码已在Molt库中开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    LoGRA:用低秩梯度草图扩展 LLM 强化学习

    LoGRA 通过低秩梯度草图保留学习信号来降低 LLM 强化学习后训练的内存占用,并结合 predicted-KL 步长控制防止过大更新破坏训练。在推理任务上,LoGRA 平均降低训练内存最多 45.7% 且不损失性能,并能在单台八卡节点上稳定训练 27B 参数模型超过 1,100 步,而稠密 Adam 在此场景下会内存耗尽。代码已在 Molt 库中开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。