arXiv cs.LG· Yuanzhe Li, Pengxin Wang, Yuxin Ren, Jianing Deng, Jingtong Hu, Song Wang, Jingdi Chen, Huanrui Yang·· 6 小时前AI 评分27
TAP:面向长程智能体的轨迹锚定高效剪枝框架
TAP: Efficient Long-Horizon Agent Pruning via Trajectory-Anchored Recovery
AI 导读
针对 RL 训练的长程智能体推理成本高的问题,研究者提出结构剪枝框架 TAP,通过轨迹锚定与 on-policy 恢复相结合,并用恢复目标的梯度迭代重评通道。在移除 60% FFN 通道后,TAP 在 ALFWorld 和 WebShop 上分别保留稠密 7B 智能体 99.2% 和 88.0% 的任务成功率,每个成功任务的 GPU 时间减少约 22% 和 17%。
来源:arXiv cs.LG · arxiv.org