跳到正文
arXiv cs.CL· Xiaoran Liu, Ziwei He, Xipeng Qiu·· 4 小时前AI 评分24

长上下文混合模型机制解析:从混合注意力到混合位置编码

Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

AI 导读

研究提出"长上下文混合模型机制",系统分析全注意力与滑动窗口注意力(SWA)或线性注意力(GLA、GDN)混合的架构差异。研究发现上下文扩展中的"跷跷板效应":LA 混合模型更受益于长上下文持续预训练,SWA 混合模型在长度外推上表现更好。

来源:arXiv cs.CL · arxiv.org