跳到正文
热点事件持续更新

Inverse-LLaVA发布v3修订版并更新基准结果

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Xuhui Zhan 与 Tyler Derr 发布 Inverse-LLaVA 论文的 v3 修订版,重新训练了模型并更新了基准测试结果,同时扩充了消融、效率与表征分析。 该方法将语言状态投影到视觉特征维度,在解码器注意力中反向完成多模态映射,用融合与 LoRA 在 665K 视觉指令上联合学习,冻结骨干且无需单独对齐阶段。 据论文报告,其 7B 模型在 VQAv2 上得分 78.45%(LLaVA-LoRA 为 79.13%),VizWiz 上为 50.96%(对比 48.56%),TextVQA 为 56.96%(对比 58.47%)。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CV
    Inverse-LLaVA:用文本到视觉映射重新思考多模态对齐

    Inverse-LLaVA 将语言状态投影到视觉特征维度,在解码器注意力中反向完成多模态映射,用融合与 LoRA 在 665K 视觉指令上联合学习,冻结骨干且无需单独对齐阶段。最终 7B 模型在 VQAv2 上得分 78.45%(LLaVA-LoRA 为 79.13%),VizWiz 上为 50.96%(对比 48.56%),TextVQA 为 56.96%(对比 58.47%)。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。