跳到正文
arXiv cs.CL· Ziyang Cheng, Yuhao Wang, Hongcheng Liu, Qimin Wu, Jingru Fan, Chen Qian, Yanfeng Wang, Yu Wang·· 1 天前AI 评分27

以文本为中心的后训练实现全模态推理:Qwen2.5-Omni-7B 推理得分提升 25.83%

Text-Centric Post-Training for Omni-Modal Reasoning

AI 导读

针对全模态大模型音视频联合推理成本高的问题,研究提出以文本为中心的后训练范式:先用纯文本训练做主推理优化,再用缩减数据的原生音视频 RL 精修感知。最佳纯文本配置下,SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理得分的几何均值较基座提升 25.83%,GPU 时长比完整原生音视频路线少 56.6%。

来源:arXiv cs.CL · arxiv.org