跳到正文
今天10月7日周三2 条
  1. arXiv cs.AI34

    后训练决定 LLM 是否按自身道德判断行事:OLMo-3、Llama-3.1、Tulu 3 对比研究

    研究构建了 248 个场景的预注册测试面板,覆盖五类压力情境,发现 OLMo-3-7B-Instruct 在约五分之一的施压场景中会做出自己判定为错误的行为。这一"言行差距"取决于后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,而基于同一 Llama-3.1 权重训练的 Ai2 Tulu 3 在整个面板上未显现。