arXiv cs.AI· Hochan Son, Kyungdoe Han, Jaehan Koh, Xiaowu Dai, Wenlu Xu, Guang Cheng·· 10 小时前AI 评分31
多智能体 LLM 推理中的持久记忆:代价、收益与可辨识性
Persistent Memory in Multi-Agent LLM Inference: What It Costs, What It Buys, and When You Can Tell
AI 导读
一项针对三层智能体架构的测量显示,将长上下文推理分解到多个协作智能体可将单次查询的峰值 KV cache 降至 14.3 MiB,而单次推理和检索增强基线分别为 35.5 和 35.3 MiB。
来源:arXiv cs.AI · arxiv.org