arXiv cs.LG· Litao Hu, Yutong Tang·· 6 小时前AI 评分34
LLM 自我改进循环中的赢家诅咒:选择噪声、锁定与接受规则
The Winner's Curse in LLM Self-Improvement Loops: Selection Noise, Lock-in, and Acceptance Rules
AI 导读
研究将 LLM 自我改进中"评分更高就保留"的步骤视为噪声下的选择问题,发现 Qwen 模型改写自身指令时,首轮之后的大多数提案都是有害的。在预注册研究中,贪心循环的选择集最终得分比留出准确率高出 13 至 20 分(16 个选择项)和 1 至 5 分(256 个选择项),且所测试的接受规则整体上未能优于贪心接受。
来源:arXiv cs.LG · arxiv.org