跳到正文
arXiv cs.AI· Seoyeon Ye, Gayoung Kim, Jiyoung Hong, Sookyung Kim, Hyunsoo Cho·· 12 小时前AI 评分44

LUMOS:追踪 LLM 参数化知识从训练数据到行为输出的因果链

LUMOS: Tracing Parametric Knowledge from Training Data to Behavioral Outputs in LLMs

AI 导读

研究者提出诊断框架 LUMOS,基于训练语料完全透明的 OLMo 2,追踪 LLM 参数化知识从训练数据曝光到行为输出的因果链。结果显示模型内部对罕见事实的编码可分性达 84%,但行为表达仅 54%,该检索差距随规模扩大而收窄。模型对已训练内容自我反思准确率为 83%,对未见内容降至随机基线 49%,且链式推理提示只会抬高置信度而非改善校准。

来源:arXiv cs.AI · arxiv.org