跳到正文
热点事件持续更新

SURGE方法从固定RL历史扩展策略集

1 篇报道1 个报道来源9 小时前更新

先了解这件事

报道摘要

论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。

摘自 arXiv cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    无需更多训练:SURGE 用 RL 历史检查点融合提升推理能力

    论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。