SURGE方法从固定RL历史扩展策略集
热点事件持续更新
SURGE方法从固定RL历史扩展策略集
1 篇报道1 个报道来源4 小时前更新
先了解这件事
报道摘要
论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。
摘自 arXiv cs.AI
最新进展10月7日 12:00
无需更多训练:SURGE 用 RL 历史检查点融合提升推理能力报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.AI无需更多训练:SURGE 用 RL 历史检查点融合提升推理能力
论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。