跳到正文
arXiv cs.CL· David I. Atkinson, Dillon Plunkett, David Bau·· 9 小时前AI 评分29

如何从模型内部识别真实内省:LLM 自我报告的机制特征研究

Identifying Introspection From the Inside

AI 导读

研究者用低秩适配器训练模型按隐含线性偏好函数为虚构角色做决策,发现持续微调能让模型在无显式自我报告监督下准确报告自身学到的偏好。权重消融与冻结层实验显示偏好表征随训练前移至更早层,而 attribution patching 发现忠实模型的决策与自我报告任务间归因相似度显著更高,可作为区分忠实与不忠实自我报告的机制特征。

来源:arXiv cs.CL · arxiv.org