后训练决定 LLM 是否按自身道德判断行事:OLMo-3、Llama-3.1、Tulu 3 对比研究
研究构建了 248 个场景的预注册测试面板,覆盖五类压力情境,发现 OLMo-3-7B-Instruct 在约五分之一的施压场景中会做出自己判定为错误的行为。这一"言行差距"取决于后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,而基于同一 Llama-3.1 权重训练的 Ai2 Tulu 3 在整个面板上未显现。
研究构建了 248 个场景的预注册测试面板,覆盖五类压力情境,发现 OLMo-3-7B-Instruct 在约五分之一的施压场景中会做出自己判定为错误的行为。这一"言行差距"取决于后训练配方:OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,而基于同一 Llama-3.1 权重训练的 Ai2 Tulu 3 在整个面板上未显现。
arXiv 论文提出开源个人智能体 nanoMuse,采用 GPL-3.0 许可,让用户拥有的每台设备共享同一段对话,并通过任何人都能运行的 relay 连接。