跳到正文
arXiv cs.AI· Ziqun Bao, Xinyu Zhang, Yuchen Shao, Chengcheng Wan·· 10 小时前AI 评分41

有害 SFT 在 LLM 检查点更新中留下连续痕迹,TRACE 实现纯权重安全审计

Harmful SFT Leaves a Continuous Trace in LLM Checkpoint Updates

AI 导读

研究发现有害合规 SFT 会在 LLM 检查点更新空间中留下连续、与目标相关的排序痕迹,检查点级坐标 s_H 在四个 7-8B 基座模型上与有害目标组成的 Spearman 相关性达 0.986-0.992,且该排序在更大规模模型上依然保持。

来源:arXiv cs.AI · arxiv.org