arXiv cs.AI· Debjyoti Saha Roy·· 11 小时前AI 评分24
Characterize Then Distill:大输出空间中的机制化推理
Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces
AI 导读
研究揭示推理训练语言模型在数千至数十万候选标签中做多标签选择时,依赖一组小型、全局、分阶段的注意力头,在 MIMIC-IV 临床编码任务(5,651 个诊断码全部入上下文)中经消融与 knock-in 验证为必要且充分。作者提出 MISTILL,在决策事件处额外监督学生模型的池化注意力,跨家族学生对比决策的因果恢复近乎翻倍。
来源:arXiv cs.AI · arxiv.org