跳到正文
热点事件持续更新

Selective-RL 选择性迁移 RL 更新

1 篇报道1 个报道来源4 小时前更新

先了解这件事

报道摘要

研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。

摘自 arXiv cs.AI

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    Selective-RL:选择性迁移 RL 更新实现视觉推理能力跨模型迁移

    研究者提出 Selective-RL,通过隔离强化学习阶段的参数更新、保留其主导矩阵方向并保持幅度,将其迁移至 VLM 的语言模块。在三个模型家族、五个视觉推理基准上,该方法在 15 项对比中有 12 项优于完整更新插值,其中 Qwen 接收模型的 MathVision 提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。