跳到正文
热点事件持续更新

研究解析长上下文混合模型并提出SWLA方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

复旦大学Xiaoran Liu、Ziwei He、Xipeng Qiu等人发表论文,提出“长上下文混合模型机制”,系统分析全注意力与滑动窗口注意力(SWA)或线性注意力(GLA、GDN)混合的架构差异,并给出Sliding-Window Linear Attention(SWLA)方法。 研究称,上下文扩展中存在“跷跷板效应”:线性注意力混合模型更受益于长上下文持续预训练,SWA混合模型在长度外推上表现更好。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    长上下文混合模型机制解析:从混合注意力到混合位置编码

    研究提出"长上下文混合模型机制",系统分析全注意力与滑动窗口注意力(SWA)或线性注意力(GLA、GDN)混合的架构差异。研究发现上下文扩展中的"跷跷板效应":LA 混合模型更受益于长上下文持续预训练,SWA 混合模型在长度外推上表现更好。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。