VLA-ACL:面向高效 Vision-Language-Action 模型的动作一致性视觉 token 剪枝
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
CtrlCache 是一个免训练的控制感知缓存框架,通过动作感知调度与刷新策略,将视频块标记为初始、过渡、转向或稳态,并在选定的去噪步骤复用 Transformer 残差,同时用频率混合历史先验引导利用低频结构。
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究者提出 AID(AI Infrastructure Dynamics)框架,用于描述物理、计算、网络与服务耦合过程中的 AI 推理基础设施学习问题,支持结构化可变状态、异步观测、多物理时间尺度和随服务变化的需求。该框架区分了现有策略下的预测表示与动作变化下保持服务结果的表示,并给出观测无法区分模型时预测误差下界及精确受控状态约简的充分条件两项分析结果。
AEGIS 是一个面向共享多 GPU 服务器的运行时调度系统,通过将内存可行性、放置后观测、运行时压力过滤、放置与 OOM 感知恢复整合进单一调度循环,实现深度学习训练工作负载的可控共置。
DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。
LionMuon 提出每 P 次迭代执行一次 Muon 谱步、其间执行 Lion 符号步,两者共享单一双 EMA 动量缓冲区,使 Muon 的计算与通信开销每 P 步仅支付一次,优化器状态仅为 AdamW 的一半。
KVCMAS 是一个在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体缓存偏差,并沿智能体工作流无缝串联修正,无需额外参考预填充,同时保留精确的首个智能体缓存。
PReCache 是一个免训练的 KV cache 共享框架,通过 PreLRShared 和 ReBaseShared 两种设计共享基于预训练权重计算的 base cache,并预计算紧凑的智能体专属低秩(LR)cache。
SketchSSM 提出"全状态更新、近似读取"方案:每次状态更新时读取一次完整状态,为离线固定的基向量预计算输出并存入紧凑草图,后续解码步骤用查询相关系数组合草图向量重建输出,无需再读全状态。
研究提出一种门控主动学习框架,将好奇心驱动采样与基于简谐振子模型拟合的物理信息质量控制过滤器结合,可在数据采集阶段自动排除低保真数据。在PbTiO3薄膜的BEPS数据集上,该方法优于随机采样、标准主动学习和多任务学习策略,并已在另一PbTiO3薄膜样品的实时自主显微镜实验中验证有效。
针对大规模推荐系统中哈希索引的嵌入向量碰撞问题,研究者提出基于线性探测的 Multi-Probe Zero Collision Hash(MPZCH),在合理表规模下可完全消除碰撞。
APEX 是一个学习型控制器,通过请求级专家选择与块级深度自适应来平衡推测解码的速度与草稿 token 浪费。APEX-Router 为每个请求在 EAGLE-3、n-gram 和草稿模型推测之间选择,APEX-Depth 则按验证块调整草稿长度。
研究提出双 IDS 框架,由量化 LSTM 的 QLSTM-IDS 与 8-bit 量化卷积自编码器的 QCAE-IDS 组成,分别检测已知与未知 CAN 总线攻击。
针对 LLM 从单轮补全转向智能体轨迹后推理硬件经济性的变化,论文用 roofline 分析和闭式 episode 延迟模型指出,智能体轨迹顺序依赖、有效 batch 为 1。
研究者提出 Hierarchy-GBP(H-GBP),一个两阶段迭代框架,先用粗化图近似(抽象)解决全局误差并投影回原图(恢复),再用 GBP 精修局部误差,并通过推导组合矩阵算子及谱半径分析证明了收敛性。
研究提出 Prefix-State Hybrid Block Attention(PHBA),用 top-k 块稀疏检索替代固定局部滑动窗口注意力,并将每个检索块与其前缀状态配对,前缀状态由块边界处的门控线性递归构建。
研究者提出 Sparse Segment Reduction(SSR),一种针对三值 LLM 与三值权重网络(TWN)推理的三值矩阵乘法方法,通过专用三值数据格式和随稀疏度扩展的计算树利用稀疏结构。
研究者提出 Tram-FL(Traveling Model Training Mechanism for Decentralized Federated Learning),通过让单个模型在节点间顺序循环训练来实现去中心化联邦学习,以最小化计算与通信开销。
Airbnb 提出 SIFT(Search Intent-to-Filter Transformer),直接从未经处理的用户行为序列学习偏好,取代人工特征工程,并统一支持预订概率、筛选器互动和房型数量阈值等多任务预测。
针对并行量化误差沿残差流累积的问题,研究者提出"激活去噪"方法,将上游误差建模为噪声,通过预处理加度量加权舍入进行正则化,在保持全并行量化的同时恢复串行量化的大部分收益,耗时仅为后者一小部分。该方法形成的深度累积平滑惩罚可抑制量化误差放大,且与量化中常用的正交旋转互补、效果叠加。
SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。
SoloQ 是一种无需校准数据的扩散语言模型量化框架,通过将权重和激活映射到归一化旋转基,实现数据无关的量化。在 LLaDA、Dream、Fast-LLM v2 和 Nemotron-Labs-Diffusion 上,SoloQ 在 4-bit 量化下保持精度并超越基于校准的基线;采用 NVFP4 时峰值内存降低最多 2.61 倍,端到端推理加速最多 2.24 倍。
亚马逊与汽车制造业合作运行的事件驱动云基础设施,三年来调度 40000+ 次生产训练任务,训练物理预测模型与强化学习控制策略的专用模型对,相比常开 GPU 基础设施降低 72-78% 成本。
新工具 Express 可将非因果注意力近似转换为具有同等近似保证的因果近似,与 SOTA 的 Thinformer 结合后,在序列长度 n 下实现 log^{3/2}(n)/s 的近似误差,仅需 O(s) 内存和 O(s^2 log^2(n)) 压缩开销。
针对 log-vMEM 模型参数随维度和滞后阶数快速增长的问题,该研究引入分层滞后结构进行正则化估计,并采用分块坐标下降算法配合 Gauss-Seidel 式更新方案。
研究在 1.375 亿行的 Trendyol 排序特征表上评测五种多列双样本漂移检测方法,发现基于 Apache Spark 的分布式最大均值差异(MMD)配合 Random Fourier Features 表现最稳健,在强漂移区间与预期漂移幅度的 Pearson 相关系数达 r = 0.940,真阳性率 80.4%,假阳性率 3.2%。
研究者提出 Sparse Asymmetric Group-Query Attention(SAGA),将 key 头与 value 头数量解耦,并搭配近似 top-N(Atop-N)稀疏注意力。
WAMJET 是一个智能体加速框架,通过为编码智能体配备可复用的优化指导与测量验证工具,加速 World Action Model(WAM)推理。它采用瓶颈驱动流程,让智能体分析推理、修改代码、验证效果并迭代优化加速栈,在六种 WAM、三种编码智能体和两种 GPU 架构上实现最高 9.95x 无损加速,近似与硬件感知优化还能进一步降低延迟且成功率相当。
KernelOPT 是一个多智能体系统,将编译后的模型视为结构化产物,保留 cuBLAS、cuDNN 等厂商库调用,仅针对生成的 Triton 子 kernel,由五个 profiling 引导的 LLM 智能体进行优化。
ValueDiff 是一种基于值几何的 KV cache 淘汰方法,按 value 向量与缓存均值的 L2 偏差对 token 排序,在弱注意力汇模型上替代依赖注意力汇的既有方案。
SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。
针对移动边缘设备上 MoE 大语言模型联邦微调中的数据异构问题,研究者提出联邦聚合对齐框架 FedAlign-MoE,通过一致性加权对齐路由分布、分布正则优化本地门控网络,并量化同索引专家的语义一致性以选择性聚合。实验显示,该框架在非 IID 联邦环境下收敛更快、精度更高,且计算轻量、通信高效。
SpecFold 通过折叠注意力与 FFN 复用父分支计算,减少扩散语言模型多分支投机验证中的冗余开销。在两类 DLLM 家族、五个模型和五个基准上,其吞吐量最高达 Spiffy 的 1.64 倍、原生解码的 1.99 倍,且任务性能相当。该算法与时间缓存正交,兼容现有 DLLM 投机策略。
BitNest 是一种位嵌套投机解码框架,将低精度草稿模型直接嵌入高精度目标模型的权重表示中,两者共享同一份物理权重,并把渐进精度设计扩展到 KV cache 以支持长上下文推理。
GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。
研究者提出 FlexSIPP 算法,通过追踪其他智能体的时间灵活性来高效重规划单个延迟智能体,避免级联延迟。该方法在荷兰铁路网络和 MovingAI MAPF 基准集上验证,能在合理时间内给出有效方案。