跳到正文
arXiv cs.CL· Baran Atalar, Xutong Liu, Jinhang Zuo, Siwei Wang, Wei Chen, Carlee Joe-Wong·· 4 小时前AI 评分22

面向低成本 LLM 服务的连续语义缓存框架

Continuous Semantic Caching for Low-Cost LLM Serving

AI 导读

研究者提出首个面向连续查询空间的语义 LLM 响应缓存理论框架,用动态 ε-net 离散化结合 Kernel Ridge Regression 在连续嵌入空间中量化估计不确定性并泛化查询成本反馈。

来源:arXiv cs.CL · arxiv.org