arXiv cs.AI· Zhishen Sun, Hongzhan Wang, Sizhe Dang, Guang Dai, Haishan Ye·· 5 小时前AI 评分30
DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放
DART-ES: Difficulty-Aware Reweighting and Targeted Replay for Fine-Tuning LLMs with Evolution Strategies
AI 导读
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
来源:arXiv cs.AI · arxiv.org