arXiv cs.LG· Subham Rath, Raj Dandekar, Rajat Dandekar, Sreedath Panat·· 9 小时前AI 评分32
研究:pass@k 无法衡量后训练后的多样性与能力保留
What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training
AI 导读
一项被 NeurIPS 2026 预训练到后训练 Workshop 接收的研究指出,pass@k 只依赖问题被答对的概率,无法反映答案分布。用 GRPO 和 RFT 训练 Qwen2.5-1.5B-Instruct 后,三项多样性指标走向相反,GRPO 正确解的词法多样性低 15%,但 pass@8 和 pass@32 在 GSM8K 上无一致赢家,仅在低 k 时出现分离。
来源:arXiv cs.LG · arxiv.org