跳到正文
arXiv cs.CL· Or Shafran, Mor Geva·· 9 小时前AI 评分22

语言模型潜在结构的因果影响力由什么决定:容量、响应性与对齐

Capacity, Responsiveness and Alignment: What Makes a Latent Structure Actionable

AI 导读

研究将语言模型激活空间中潜在结构的因果影响力拆解为容量、响应性与对齐三个因素,在4个LM家族和50个概念上验证三者需同时较高才有效。容量或响应性偏低分别使因果效果下降84%和95%,对齐偏低甚至会逆转效果、抑制概念表达。基于此提出的因果探针将跨模型引导效果提升17%-118%,概念检测仅下降3%。

来源:arXiv cs.CL · arxiv.org