研究:LLM自我改进循环存在选择偏差
热点事件持续更新
研究:LLM自我改进循环存在选择偏差
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
一项 arXiv 论文将 LLM 自我改进中“评分更高就保留”的步骤视为噪声下的选择问题,发现 Qwen 模型改写自身指令时,首轮之后的大多数提案都是有害的。 在预注册研究中,贪心循环的选择集最终得分比留出准确率高出 13 至 20 分(16 个选择项)和 1 至 5 分(256 个选择项),且所测试的接受规则整体上未能优于贪心接受。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
LLM 自我改进循环中的赢家诅咒:选择噪声、锁定与接受规则报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.LGLLM 自我改进循环中的赢家诅咒:选择噪声、锁定与接受规则
研究将 LLM 自我改进中"评分更高就保留"的步骤视为噪声下的选择问题,发现 Qwen 模型改写自身指令时,首轮之后的大多数提案都是有害的。在预注册研究中,贪心循环的选择集最终得分比留出准确率高出 13 至 20 分(16 个选择项)和 1 至 5 分(256 个选择项),且所测试的接受规则整体上未能优于贪心接受。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。