arXiv cs.CV· Dongchen Si, Di Wang, Mingzhen Xu, Jing Zhang, Bo Du, Liangpei Zhang·· 5 小时前AI 评分22
RSJEV:用多模态大语言模型做判别式遥感场景分类
RSJEV: Discriminative Remote Sensing Scene Classification with Multimodal Large Language Models
AI 导读
针对遥感场景分类,研究者提出 RSJEV,将分类重构为候选类别条件下的多模态判别式决策过程,用 OnePass Decider 直接估计类别概率,省去自回归解码。在 UC Merced、AID、NWPU-RESISC45 三个基准上,RSJEV 性能优于代表性 CNN、Transformer、Mamba、CLIP 和 MLLM 方法,并以仅 0.8B 参数模型显著降低推理成本。代码将公开。
来源:arXiv cs.CV · arxiv.org