arXiv cs.LG· Lee Seung-woo, Bowen Qi, Kim Min-jun, Jang Won-young·· 9 小时前AI 评分24
SkillFormer:面向音频语言模型的技能分解适配方法
SkillFormer: Skill-Decomposed Adaptation for Audio Language Models
AI 导读
SkillFormer 将音频理解分解为技能专属的低秩适配器,并通过学习到的路由器在推理时按问题动态组合激活,使音高查询与曲风分类查询调用不同参数。该方法仅增加不到 4% 的基座模型参数,无需改动音频编码器或语言主干,在三种架构不同的模型及 MMSU、MMAU-Pro、MMAR 上平均准确率提升 2.5 至 4.1 分。
来源:arXiv cs.LG · arxiv.org