arXiv cs.LG· Nilushika Udayangania, Kishor Nandakishora, Marimuthu Palaniswami·· 5 小时前AI 评分17
MemKD:面向紧凑循环神经网络的时间序列记忆保留知识蒸馏框架
Learning to Remember: Distilling Memory Retention for Compact Recurrent Neural Networks
AI 导读
研究者提出知识蒸馏框架 MemKD,通过专门的损失函数捕捉教师与学生模型在时间序列子序列上的记忆保留差异,让紧凑循环神经网络更有效地模仿教师行为。实验显示 MemKD 显著优于现有 SOTA 知识蒸馏方法,并能在多种压缩比例下匹配教师模型性能,大幅减少参数量和内存占用而精度损失不显著。
来源:arXiv cs.LG · arxiv.org