跳到正文
arXiv cs.LG· James Mickens·· 6 小时前AI 评分36

LLM 安全中的语言不可读性问题

The Implications of Linguistic Illegibility for LLM Security

AI 导读

研究者提出“语言不可读性”概念,指 LLM 的外部语言输出与机制提取的语言特征无法可靠反映模型内部计算,因为内部计算是在激活空间上做数学运算,与自然语言之间存在有损转换。若该问题不可避免,依赖模型语言自报告的链式思维监控、宪法式自我批评、激活探测等安全机制就永远无法完全可靠。论文主张用污点追踪观察模型输出,并辅以稳健虚拟化、第三方审计等沙箱机制,为语言监控提供底层保障。

来源:arXiv cs.LG · arxiv.org