PReCache:面向多 LoRA 智能体的免训练 KV cache 共享框架
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
SketchSSM 提出"全状态更新、近似读取"方案:每次状态更新时读取一次完整状态,为离线固定的基向量预计算输出并存入紧凑草图,后续解码步骤用查询相关系数组合草图向量重建输出,无需再读全状态。
研究提出一种门控主动学习框架,将好奇心驱动采样与基于简谐振子模型拟合的物理信息质量控制过滤器结合,可在数据采集阶段自动排除低保真数据。在PbTiO3薄膜的BEPS数据集上,该方法优于随机采样、标准主动学习和多任务学习策略,并已在另一PbTiO3薄膜样品的实时自主显微镜实验中验证有效。
针对大规模推荐系统中哈希索引的嵌入向量碰撞问题,研究者提出基于线性探测的 Multi-Probe Zero Collision Hash(MPZCH),在合理表规模下可完全消除碰撞。
APEX 是一个学习型控制器,通过请求级专家选择与块级深度自适应来平衡推测解码的速度与草稿 token 浪费。APEX-Router 为每个请求在 EAGLE-3、n-gram 和草稿模型推测之间选择,APEX-Depth 则按验证块调整草稿长度。
研究提出双 IDS 框架,由量化 LSTM 的 QLSTM-IDS 与 8-bit 量化卷积自编码器的 QCAE-IDS 组成,分别检测已知与未知 CAN 总线攻击。
针对 LLM 从单轮补全转向智能体轨迹后推理硬件经济性的变化,论文用 roofline 分析和闭式 episode 延迟模型指出,智能体轨迹顺序依赖、有效 batch 为 1。
研究者提出 Hierarchy-GBP(H-GBP),一个两阶段迭代框架,先用粗化图近似(抽象)解决全局误差并投影回原图(恢复),再用 GBP 精修局部误差,并通过推导组合矩阵算子及谱半径分析证明了收敛性。
研究提出 Prefix-State Hybrid Block Attention(PHBA),用 top-k 块稀疏检索替代固定局部滑动窗口注意力,并将每个检索块与其前缀状态配对,前缀状态由块边界处的门控线性递归构建。
研究者提出 Sparse Segment Reduction(SSR),一种针对三值 LLM 与三值权重网络(TWN)推理的三值矩阵乘法方法,通过专用三值数据格式和随稀疏度扩展的计算树利用稀疏结构。
研究者提出 Tram-FL(Traveling Model Training Mechanism for Decentralized Federated Learning),通过让单个模型在节点间顺序循环训练来实现去中心化联邦学习,以最小化计算与通信开销。
Airbnb 提出 SIFT(Search Intent-to-Filter Transformer),直接从未经处理的用户行为序列学习偏好,取代人工特征工程,并统一支持预订概率、筛选器互动和房型数量阈值等多任务预测。
针对并行量化误差沿残差流累积的问题,研究者提出"激活去噪"方法,将上游误差建模为噪声,通过预处理加度量加权舍入进行正则化,在保持全并行量化的同时恢复串行量化的大部分收益,耗时仅为后者一小部分。该方法形成的深度累积平滑惩罚可抑制量化误差放大,且与量化中常用的正交旋转互补、效果叠加。
SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。
SoloQ 是一种无需校准数据的扩散语言模型量化框架,通过将权重和激活映射到归一化旋转基,实现数据无关的量化。在 LLaDA、Dream、Fast-LLM v2 和 Nemotron-Labs-Diffusion 上,SoloQ 在 4-bit 量化下保持精度并超越基于校准的基线;采用 NVFP4 时峰值内存降低最多 2.61 倍,端到端推理加速最多 2.24 倍。
亚马逊与汽车制造业合作运行的事件驱动云基础设施,三年来调度 40000+ 次生产训练任务,训练物理预测模型与强化学习控制策略的专用模型对,相比常开 GPU 基础设施降低 72-78% 成本。
新工具 Express 可将非因果注意力近似转换为具有同等近似保证的因果近似,与 SOTA 的 Thinformer 结合后,在序列长度 n 下实现 log^{3/2}(n)/s 的近似误差,仅需 O(s) 内存和 O(s^2 log^2(n)) 压缩开销。
针对 log-vMEM 模型参数随维度和滞后阶数快速增长的问题,该研究引入分层滞后结构进行正则化估计,并采用分块坐标下降算法配合 Gauss-Seidel 式更新方案。
研究在 1.375 亿行的 Trendyol 排序特征表上评测五种多列双样本漂移检测方法,发现基于 Apache Spark 的分布式最大均值差异(MMD)配合 Random Fourier Features 表现最稳健,在强漂移区间与预期漂移幅度的 Pearson 相关系数达 r = 0.940,真阳性率 80.4%,假阳性率 3.2%。
研究者提出 Sparse Asymmetric Group-Query Attention(SAGA),将 key 头与 value 头数量解耦,并搭配近似 top-N(Atop-N)稀疏注意力。
WAMJET 是一个智能体加速框架,通过为编码智能体配备可复用的优化指导与测量验证工具,加速 World Action Model(WAM)推理。它采用瓶颈驱动流程,让智能体分析推理、修改代码、验证效果并迭代优化加速栈,在六种 WAM、三种编码智能体和两种 GPU 架构上实现最高 9.95x 无损加速,近似与硬件感知优化还能进一步降低延迟且成功率相当。
KernelOPT 是一个多智能体系统,将编译后的模型视为结构化产物,保留 cuBLAS、cuDNN 等厂商库调用,仅针对生成的 Triton 子 kernel,由五个 profiling 引导的 LLM 智能体进行优化。
ValueDiff 是一种基于值几何的 KV cache 淘汰方法,按 value 向量与缓存均值的 L2 偏差对 token 排序,在弱注意力汇模型上替代依赖注意力汇的既有方案。
SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。
针对移动边缘设备上 MoE 大语言模型联邦微调中的数据异构问题,研究者提出联邦聚合对齐框架 FedAlign-MoE,通过一致性加权对齐路由分布、分布正则优化本地门控网络,并量化同索引专家的语义一致性以选择性聚合。实验显示,该框架在非 IID 联邦环境下收敛更快、精度更高,且计算轻量、通信高效。
SpecFold 通过折叠注意力与 FFN 复用父分支计算,减少扩散语言模型多分支投机验证中的冗余开销。在两类 DLLM 家族、五个模型和五个基准上,其吞吐量最高达 Spiffy 的 1.64 倍、原生解码的 1.99 倍,且任务性能相当。该算法与时间缓存正交,兼容现有 DLLM 投机策略。
BitNest 是一种位嵌套投机解码框架,将低精度草稿模型直接嵌入高精度目标模型的权重表示中,两者共享同一份物理权重,并把渐进精度设计扩展到 KV cache 以支持长上下文推理。
GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。
研究者提出 FlexSIPP 算法,通过追踪其他智能体的时间灵活性来高效重规划单个延迟智能体,避免级联延迟。该方法在荷兰铁路网络和 MovingAI MAPF 基准集上验证,能在合理时间内给出有效方案。
针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。
X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
针对视觉世界模型决策时动作搜索规划预算过大、迭代规划器重复编码不变上下文的问题,研究者提出部署框架 SufficientPlan,无需修改预训练世界模型或规划器更新。
DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。
VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。
ReFold 是一种免训练的渲染层方法,可在保留底层交互历史的同时压缩模型渲染的上下文,无需辅助预测器即可去除轮间冗余,且每次删除严格可逆。在五个长程基准和两个前沿 LLM 上,它将 token 消耗降低最多 2.5 倍、每会话 KV-cache 内存减半,且不降低任务成功率。
研究者提出 Dev-Primitives(开发原语),把仓库组件与其常驻 LLM 配对,使其具备自然语言推理、组件间通信和局部自我修改能力,并据此构建 Harness Engineering 框架 HERMES。
机器学习编译器 Cleave 通过符号化解耦,将代数变换搜索与算子调度分离,在常见 LLM 子图上生成的 kernel 比最优基线最高快 2.8 倍(平均 1.6 倍),编译时间比 Mirage 平均减少 5.9 倍。
AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。