跳到正文
热点事件观察中

KCCA方法提升VLM视觉表征准确率

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Peilin Yang等作者提出基于核典型相关分析(KCCA)的特征子空间对齐方法,并扩展为三视图3vKCCA,将预训练文本编码器的投影纳入统一优化框架联合对齐。 在ImageNet-1K上使用CLIP ViT-L/14测试,3vKCCA将MMVP-VLM准确率从17.8提升至25.9,同时保持零样本图文检索性能。

AI 根据报道生成 · 14 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CV
    通过核典型相关分析重新审视 VLM 的视觉表征增强

    研究提出基于核典型相关分析(KCCA)的特征子空间对齐方法,并扩展为三视图 3vKCCA,将预训练文本编码器的投影纳入统一优化框架联合对齐。在 ImageNet-1K 上使用 CLIP ViT-L/14,3vKCCA 将 MMVP-VLM 准确率从 17.8 提升至 25.9,同时保持零样本图文检索性能。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。