跳到正文
arXiv stat.ML· Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Stefan Feuerriegel, Dennis Frauen·· 4 小时前AI 评分22

无需似然度的 Best-of-N 策略评估框架 BoN-DR 提出

Efficient Best-of-N policy evaluation for inference-time alignment

AI 导读

研究者提出仅依赖样本的 Best-of-N(BoN)策略评估框架,无需访问响应似然度即可估计策略价值。该框架利用 BoN 的次序统计结构,将所需密度比转化为可从样本估计的分数-排名概率,并给出双重稳健估计器 BoN-DR,可跨候选预算复用共享辅助样本池。在合成实验和 GSM8K 上,该框架能准确估计 BoN 策略价值并选出有效采样预算。

来源:arXiv stat.ML · arxiv.org