DART-ES:难度感知进化策略微调LLM
热点事件持续更新
DART-ES:难度感知进化策略微调LLM
1 篇报道1 个报道来源9 小时前更新
先了解这件事
AI 综述
Zhishen Sun 等作者提出面向进化策略(ES)微调大语言模型的 DART-ES 方法,通过扰动种群通过率估计题目局部可解性,并聚合历史观测构建动态难度状态,据此进行难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。 作者称,DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
AI 根据报道生成 · 8 小时前更新
最新进展10月7日 12:00
DART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.AIDART-ES:面向 Evolution Strategies 微调 LLM 的难度感知重加权与定向回放
DART-ES 通过扰动种群通过率估计题目局部可解性并聚合历史观测构建动态难度状态,联合指导难度重加权与稀有可解样本回放,无需额外难度模型或反向传播。它在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率达 49.20%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。