arXiv cs.CV· Xuhui Zhan, Tyler Derr·· 3 小时前AI 评分26
Inverse-LLaVA:用文本到视觉映射重新思考多模态对齐
Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping
AI 导读
Inverse-LLaVA 将语言状态投影到视觉特征维度,在解码器注意力中反向完成多模态映射,用融合与 LoRA 在 665K 视觉指令上联合学习,冻结骨干且无需单独对齐阶段。最终 7B 模型在 VQAv2 上得分 78.45%(LLaVA-LoRA 为 79.13%),VizWiz 上为 50.96%(对比 48.56%),TextVQA 为 56.96%(对比 58.47%)。
来源:arXiv cs.CV · arxiv.org