跳到正文
arXiv cs.CV· Junhyeok Kim, Jinyeong Kim, Jae Wan Park, Seong Jae Hwang·· 4 小时前AI 评分22

研究:Vision Transformer 中 Attention-FFN 分离结构的必要性

On the Necessity of Attention-FFN Split in Vision Transformers

AI 导读

研究提出 AttenFeed 模块与统一 Vision Transformer(uViT),用 AttenFeed 模块序列替代传统 Attention-FFN 交替结构,以检验 ViT 中 Attention-FFN 二分的必要性。在多个数据集和模型规模上的对比实验显示,这种二分结构会因 ViT 参数分配的刚性而在较小模型规模下拖累性能。

来源:arXiv cs.CV · arxiv.org