arXiv cs.CV· Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai·· 3 小时前AI 评分30
从文本到视觉能迁移什么?VLM 的能力缩放定律与迁移动态
What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs
AI 导读
研究者提出 Capability-Driven Multimodal Scaling Law,首个跨模型家族、通过可观测文本能力预测 VLM 基准准确率的框架。
来源:arXiv cs.CV · arxiv.org