跳到正文
arXiv cs.AI· Stephanie Buttigieg, Maeve Madigan, Parameswaran Kamalaruban, Stuart Burrell·· 5 小时前AI 评分29

研究揭示 LLM 潜在空间偏见方向实际编码的是模型置信度而非公平性

Latent space bias directions in LLMs capture confidence, not fairness

AI 导读

研究分析激活引导所用去偏见方向的实际编码内容,发现该方向由模型置信度主导,在激活空间中指向高概率到低概率 token 区域,而非编码有意义的偏见表征。沿该方向引导虽能降低偏见指标,但实为降低模型置信度所致:在 QA 基准上模型因此拒绝作答,附带改善了公平性指标。研究指出,将偏见线性表征与模型置信度解耦十分困难,基于引导的去偏见结果需谨慎解读。

来源:arXiv cs.AI · arxiv.org