跳到正文
arXiv cs.LG· Sungyoon Kim, Kaan Ozkara, Youngsuk Park·· 3 小时前AI 评分23

用链式 LMO 优化大语言模型:TensorChain 在 Qwen3 预训练中比 Muon 省 9.6% token

Optimizing Large Language Models with Chained LMOs

AI 导读

研究者提出链式线性最小化预言机(chained LMOs)框架,将 Muon 等由多个矩阵归一化组合而成的优化器统一为 LMO 的组合形式,并指出许多链式方法超出标准 LMO 框架、在光滑凸目标上可能发散。

来源:arXiv cs.LG · arxiv.org