跳到正文
arXiv cs.CL· Shrey Shah, Yinheng Li·· 9 小时前AI 评分21

Holdout Best-of-N:无偏评估及其代价

Holdout Best-of-N: Unbiased Evaluation and Its Cost

AI 导读

研究指出,复用挑选 Best-of-N 获胜者的分数会高估其期望奖励。基于每个候选 K 个独立分数的固定矩阵,仅当 J<K 时,单一估计量才能对期望评判奖励完全无偏;在 J=K-1 时,无偏 minimax 风险为 σ²/√K 量级,允许偏差则可提升至 σ²/K。对两个候选者,Holdout 无需已知方差即可达到 1/(π√2) 的渐近无偏 minimax 常数。

来源:arXiv cs.CL · arxiv.org