arXiv cs.AI· Srikar Alla, Ali Shiri Sichani, Chi-Ren Shyu·· 11 小时前AI 评分17
QEMFN:基于可训练纠缠的资源感知混合视觉语言融合网络
Quantum Entangled Multimodal Fusion Networks (QEMFN): Resource-Aware Hybrid Vision-Language Fusion via Trainable Entanglement
AI 导读
研究者提出量子纠缠多模态融合网络(QEMFN),将预训练视觉与文本特征投影为角度参数化量子态,经模态内与跨模态纠缠电路测量后生成融合表示。在参数预算匹配且冻结同一 CLIP 骨干的条件下,QEMFN 在 COCO-5k 和 Flickr30k 上优于多层感知机、张量融合、FiLM、交叉注意力、紧凑 Transformer 及去量子化的配对拓扑对照等经典融合基线。
来源:arXiv cs.AI · arxiv.org