跳到正文
arXiv cs.CL· Jongwook Yoon, Jongwon Lim, Sungjib Lim, Woojin Cho, Yohan Jo·· 4 小时前AI 评分31

LLM 如何处理否定?研究揭示注意力头与 MLP 神经元机制并提训练目标

How Do LLMs Change Predictions Under Negation?

AI 导读

研究评估近期开源与闭源 LLM 的否定处理能力,发现 37-71% 的情况下模型在否定句下重复原答案。机制分析显示,专门的注意力头与 MLP 神经元通过抑制原答案检索、同时提升同类候选答案来共同实现否定,这与人类利用原答案信息确定排除对象的处理方式不同。作者据此提出一种训练目标,要求对更自信的原预测产生更大的答案偏好偏移,相比标准微调基线能减少否定失败且对通用能力损害更小。

来源:arXiv cs.CL · arxiv.org