跳到正文
arXiv cs.LG· Lee Seung-woo, Bowen Qi, Kim Min-jun, Jang Won-young·· 9 小时前AI 评分24

SkillFormer:面向音频语言模型的技能分解适配方法

SkillFormer: Skill-Decomposed Adaptation for Audio Language Models

AI 导读

SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。

来源:arXiv cs.LG · arxiv.org