跳到正文
arXiv cs.LG· Vit\'oria Barin-Pacela, Shruti Joshi, Isabela Camacho, Simon Lacoste-Julien, David Klindt·· 3 小时前AI 评分32

别再探针了,开始编码:为何线性探针与稀疏自编码器在组合泛化上失败

Stop Probing, Start Coding: Why Linear Probes and Sparse Autoencoders Fail at Compositional Generalisation

AI 导读

研究发现稀疏自编码器(SAEs)在分布外组合泛化上失败,根源在于字典学习而非推理过程:SAE 学到的字典方向严重偏离,即便用逐样本 FISTA 替换编码器也无法弥合差距。该摊销差距在不同训练集规模、潜维度和稀疏度下持续存在,而 oracle 基线证明只要字典足够好问题即可解决。在 Pythia-70M 和 Gemma-2-2B 真实 LLM 激活上的实验将 SAE 失败重新定义为字典学习挑战。

来源:arXiv cs.LG · arxiv.org