跳到正文
今天10月7日周三4 条
  1. arXiv cs.AI36

    无需更多训练:SURGE 用 RL 历史检查点融合提升推理能力

    论文提出 policy-space scaling,通过融合同一次 RL 训练中的两个检查点,在不延长训练、不增加单次推理计算的前提下获得更强策略。方法 SURGE 将高精度 anchor 与生成更短回复的 donor 表示为相对共享初始化的更新,再对 anchor 更新做谱分解,保留其主导成分并融入 donor 的互补成分。