跳到正文
arXiv cs.CV· Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai·· 3 小时前AI 评分30

从文本到视觉能迁移什么?VLM 的能力缩放定律与迁移动态

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

AI 导读

研究者提出 Capability-Driven Multimodal Scaling Law,首个跨模型家族、通过可观测文本能力预测 VLM 基准准确率的框架。

来源:arXiv cs.CV · arxiv.org