跳到正文
热点事件持续更新

研究者提出TACO优化器降低LLM微调显存

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

研究者 Jichao Jiang 等人提出名为 TACO 的优化器,用于降低大语言模型微调时的优化器状态内存占用。其做法是按列选取二维权重矩阵中绝对值最大元素的符号,在维度归一化的 1→1 算子范数下计算最速下降方向。 据该研究称,TACO 在保留一阶梯度的同时,使优化器状态内存近乎可忽略,且不牺牲精度或计算效率。该工作沿用 Muon 的算子范数最速下降思路,并将其几何路径进一步推进。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    TACO:面向 LLM 微调的三值绝对最大值列稀疏优化器

    研究者提出 TACO 优化器,通过按列选取二维权重矩阵中绝对值最大元素的符号,在维度归一化的 1→1 算子范数下计算精确最速下降方向,保留一阶梯度同时让优化器状态内存近乎可忽略。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。