跳到正文
arXiv cs.LG· Tue M. Cao, Hoang X. Nhat, Raed Alharbi, Phi Le Nguyen, My T. Thai·· 6 小时前AI 评分22

Tree SAE:在稀疏自编码器中学习层级特征结构

Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders

AI 导读

针对稀疏自编码器(SAE)仅靠激活覆盖判断层级关系会产生语义无关的假阳性问题,研究者提出 Tree SAE,通过同时施加激活约束与新的重建约束,从特征集内部直接学习层级结构。结果显示,Tree SAE 在学习层级特征对方面显著优于现有 SAE,同时在多个关键基准上保持与 SOTA 相当的性能。该模型还被用于刻画子特征子空间的几何结构,并揭示大语言模型中编码的复杂层级概念结构。

来源:arXiv cs.LG · arxiv.org