跳到正文
arXiv cs.AI· Yusong Zhao, Hengyi Wang, Tanuja Ganu, Akshay Nambi, Hao Wang·· 9 小时前AI 评分22

SAE++:级联稀疏自编码器学习多模态 LLM 的多层级视觉概念

SAE++: Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs

AI 导读

SAE++ 是一种级联稀疏自编码器架构,通过在初级 SAE 的解码器权重上训练二级 SAE,学习多模态 LLM 中的层级视觉概念,避免嵌套式共享前缀耦合与朴素堆叠的瓶颈。在 Qwen3-VL、Gemma-3 和 LLaVA 上的多组视觉数据集实验中,SAE++ 在层级概念一致性上优于当前最优 SAE 基线,并支持对 MLLM 输出进行组级概念干预。代码已开源。

来源:arXiv cs.AI · arxiv.org