arXiv cs.AI· Xin Chen, Gil Kur, Alexander Shevchenko, Andreas Krause·· 10 小时前AI 评分27
局部稀疏性实现无监督 LLM 安全检测
Local Sparsity Enables Unsupervised LLM Safety Detection
AI 导读
研究者提出基于局部掩码 SAE 的无监督异常检测框架,利用线性表示假设下邻近点共享小共同活跃支撑的特性,在多种架构和数据集上验证了 LLM 安全检测的可行性。当允许使用 1% 的分布外数据校准时,该方法达到接近最优的性能,且仅需 1-2% 的 SAE 神经元参与计算。该工作发表于 NeurIPS2026。
来源:arXiv cs.AI · arxiv.org