跳到正文
arXiv cs.CL· Orion Reblitz-Richardson·· 4 小时前AI 评分29

LLM 如何组织与构建道德知识:线性探针揭示道德基础在表征空间中的几何结构

How Language Models Organize and Structure Moral Knowledge

AI 导读

研究者用六个独立线性探针在开放权重语言模型上分别探测 Moral Foundations Theory 的六类道德基础,发现这些方向既不塌缩为单一道德检测器,也不彼此孤立,而是张成接近最大数量的独立维度并共享一个正向公共分量。

来源:arXiv cs.CL · arxiv.org