arXiv cs.AI· Tong Che, Yilong Li·· 11 小时前AI 评分24
LLM 内部特征不等于模型机制:论文提出区分"引导"与"使用"的实证检验方法
Does the Model Use the Feature? Separating Steering from Mechanism in LLMs
AI 导读
针对 LLM 内部特征常被当作模型机制的问题,研究者提出一套实证契约,在自然输入观测值上检验特征:通过 installation(将表现某行为的输入特征值复制到不表现的匹配输入)和 removal(反向操作)以及 downstream rescue(上游编辑后恢复特征)来区分特征是否被模型真正使用。
来源:arXiv cs.AI · arxiv.org