跳到正文
arXiv cs.CL· Hanhan Zhou, Shamik Roy, Rashmi Gangadharaiah·· 4 小时前AI 评分22

离散扩散语言模型的机制引导干预:自适应调度实现精准控制

Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models

AI 导读

研究者发现离散扩散语言模型(DLM)中不同属性的涌现时间差异显著——在 MDLM 上主题在前 2% 去噪步骤内即确定,而情感则需 20% 过程逐步形成。基于在四个 DLM(124M-8B 参数)上训练的稀疏自编码器分析,团队提出自适应调度机制,将干预集中在各属性活跃形成阶段。在七项单属性与多属性控制任务中,该方法持续优于均匀干预基线。

来源:arXiv cs.CL · arxiv.org