跳到正文
arXiv cs.AI· Xin Chen, Gil Kur, Alexander Shevchenko, Andreas Krause·· 10 小时前AI 评分27

局部稀疏性实现无监督 LLM 安全检测

Local Sparsity Enables Unsupervised LLM Safety Detection

AI 导读

研究者提出基于局部掩码 SAE 的无监督异常检测框架,利用线性表示假设下邻近点共享小共同活跃支撑的特性,在多种架构和数据集上验证了 LLM 安全检测的可行性。当允许使用 1% 的分布外数据校准时,该方法达到接近最优的性能,且仅需 1-2% 的 SAE 神经元参与计算。该工作发表于 NeurIPS2026。

来源:arXiv cs.AI · arxiv.org