跳到正文
热点事件持续更新

研究:LLM自我改进循环存在选择偏差

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

一项 arXiv 论文将 LLM 自我改进中“评分更高就保留”的步骤视为噪声下的选择问题,发现 Qwen 模型改写自身指令时,首轮之后的大多数提案都是有害的。 在预注册研究中,贪心循环的选择集最终得分比留出准确率高出 13 至 20 分(16 个选择项)和 1 至 5 分(256 个选择项),且所测试的接受规则整体上未能优于贪心接受。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.LG
    LLM 自我改进循环中的赢家诅咒:选择噪声、锁定与接受规则

    研究将 LLM 自我改进中"评分更高就保留"的步骤视为噪声下的选择问题,发现 Qwen 模型改写自身指令时,首轮之后的大多数提案都是有害的。在预注册研究中,贪心循环的选择集最终得分比留出准确率高出 13 至 20 分(16 个选择项)和 1 至 5 分(256 个选择项),且所测试的接受规则整体上未能优于贪心接受。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。