跳到正文
arXiv cs.AI· Fan Huang, Haewoon Kwak, Jisun An·· 10 小时前AI 评分22

大语言模型道德推理轨迹研究:面向基于探针的可解释性

Understanding Moral Reasoning Trajectories in Large Language Models: Toward Probing-Based Explainability

AI 导读

研究提出"道德推理轨迹"概念,追踪 LLM 中间推理步骤中伦理框架的调用序列,在六个模型和三个基准上发现 55.4–57.7% 的连续步骤发生框架切换,仅 16.4–17.8% 的轨迹保持框架一致。

来源:arXiv cs.AI · arxiv.org