arXiv cs.LG· Xilin Wang, David Bau, Byron C. Wallace·· 6 小时前AI 评分25
如何训练你的模型生物:对齐可解释性研究中的多目标验证框架
How to train your model organism
AI 导读
针对对齐可解释性研究中"模型生物"仅以植入目标行为为单一训练目标的问题,研究者提出应从目标行为植入、通用能力保持(参数化知识、对话质量)和输出自然性(CoT 与激活)三个维度进行验证。
来源:arXiv cs.LG · arxiv.org