arXiv stat.ML· Hong Ha Le, Jackie Lok, Atsushi Nitanda, Yan Shuo Tan·· 11 小时前AI 评分12
软注意力如何学习上下文中的决策树桩阈值:Softmax Attention 动态分析
Learning Decision-Stump Thresholds in Context: Dynamics of Softmax Attention
AI 导读
研究用两参数 softmax-attention 模型分析基于梯度的预训练如何学习决策阈值:在大分辨率初始化下,对 m 个任务(每个 n 个样本)做恒定步长梯度下降,可得到误差为 Õ((m∧n)⁻¹+N⁻¹) 的冻结估计器,两项分别对应有限预训练精度与新上下文定位。
来源:arXiv stat.ML · arxiv.org