arXiv cs.AI· Ali Janati, Kaoutar El Maghraoui, Anass Belfatmi·· 14 小时前AI 评分22
Muon 训练的 Transformer 在表征-读出接口处的 Post-Grokking 崩塌
Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers
AI 导读
Muon 训练的模运算 Transformer 会在保留线性可解码任务信息的同时丢失准确率,相邻交换将五例未归一化失败定位到 AdamW 读出更新。仅用训练数据训练的 decoder 可恢复 98.20-100% 的留出准确率,修正交叉熵导数错误后五条匹配分支稳定训练至 100,000 步。
来源:arXiv cs.AI · arxiv.org