跳到正文
arXiv cs.CL· Sripad Karne·· 4 小时前AI 评分32

SAE 自动解释标签的泛化能力有多强:一项跨语言、文字与改写形式的受控研究

How Far Do Auto-Interpretation Labels Generalize: A Controlled Study Across Languages, Scripts, and Rewordings

AI 导读

研究以塞尔维亚语双语书写系统为受控测试台,发现同一内容在不同语言、文字和措辞下激活的 SAE 特征集有显著重叠(平均 Jaccard 0.39,随机基线 0.13,最高 0.57)。但自动解释标签往往跟不上:描述语义内容的特征在塞尔维亚语中漏掉同一含义的频率最高可达英语内的 4 倍,且漏掉塞尔维亚语西里尔字母多于拉丁字母。这一差距随网络深度增大,标签却未显示失效迹象。

来源:arXiv cs.CL · arxiv.org