跳到正文
arXiv cs.AI· Tong Che, Yilong Li·· 11 小时前AI 评分24

LLM 内部特征不等于模型机制:论文提出区分"引导"与"使用"的实证检验方法

Does the Model Use the Feature? Separating Steering from Mechanism in LLMs

AI 导读

针对 LLM 内部特征常被当作模型机制的问题,研究者提出一套实证契约,在自然输入观测值上检验特征:通过 installation(将表现某行为的输入特征值复制到不表现的匹配输入)和 removal(反向操作)以及 downstream rescue(上游编辑后恢复特征)来区分特征是否被模型真正使用。

来源:arXiv cs.AI · arxiv.org