跳到正文
arXiv cs.AI· Jeremy Canale·· 10 小时前AI 评分34

迈向对齐扩展定律:一个框架与首批预注册测量

Toward Alignment Scaling Laws: A Framework and First Preregistered Measurements

AI 导读

研究提出对齐扩展定律框架,将对齐负担建模为 B_r(N)=a_rN^alpha_r,并给出三种负担操作化方式,区分观测、审计与真实对齐。预注册再分析显示,Pythia 分类器把攻击成功率压到 10% 以下所需算力按 N^0.60 增长;Qwen2.5 0.5B-72B 试点中,真实性指数为 -0.05、陈述倾向为 0.48,谄媚与植入后门尚未确定。

来源:arXiv cs.AI · arxiv.org