跳到正文
arXiv cs.AI· Yihao Wang, Haoran Xu, Renjie Gu, Yixuan Ye, Xinyi Chen, Xinyu Mu, Yuan Gao, Chunxiao Guo, Peng Wei, Jinjie Gu, Huan Li, Ke Chen, Lidan Shou·· 3 小时前AI 评分29

MedMemoryBench:面向个性化医疗智能体的记忆基准测试

MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

AI 导读

研究者推出 MedMemoryBench,用于评测个性化医疗智能体的记忆机制,数据集约含 2,000 个会话、16,000 轮交互。该基准采用"边构建边评估"的流式评测协议,并系统研究了信息持续涌入导致检索与推理能力下降的记忆饱和现象。评测显示主流架构在复杂医疗推理与噪声鲁棒性上存在严重瓶颈。

来源:arXiv cs.AI · arxiv.org