跳到正文
今天10月7日周三131 条
  1. arXiv cs.LG22

    基于高斯过程的质量控制主动学习:面向自主显微镜中鲁棒结构-性能学习

    研究提出一种门控主动学习框架,将好奇心驱动采样与基于简谐振子模型拟合的物理信息质量控制过滤器结合,可在数据采集阶段自动排除低保真数据。在PbTiO3薄膜的BEPS数据集上,该方法优于随机采样、标准主动学习和多任务学习策略,并已在另一PbTiO3薄膜样品的实时自主显微镜实验中验证有效。

  2. arXiv cs.LG22

    激活去噪:并行与串行 LLM 量化鲁棒性对比研究

    针对并行量化误差沿残差流累积的问题,研究者提出"激活去噪"方法,将上游误差建模为噪声,通过预处理加度量加权舍入进行正则化,在保持全并行量化的同时恢复串行量化的大部分收益,耗时仅为后者一小部分。该方法形成的深度累积平滑惩罚可抑制量化误差放大,且与量化中常用的正交旋转互补、效果叠加。

  3. arXiv cs.LG22

    SemARC:通过自适应采集与序列融合实现高效多模态推理

    SemARC 将序列模态聚合器(SeMA)与自适应运行时控制器(ARC)结合,在编码器运行前就选定下一个模态,只执行被选中的编码与融合分支。在六个多模态分类数据集和十一个基线上,SemARC 平均宏 F1 提升 3.2%、总推理 GFLOPs 降低 61.4%,端到端延迟在 GPU 与 CPU 上下降 44.0%、Android INT8 上下降 47.2%。

  4. arXiv cs.LG24

    SoloQ:面向扩散语言模型的无校准量化框架

    SoloQ 是一种无需校准数据的扩散语言模型量化框架,通过将权重和激活映射到归一化旋转基,实现数据无关的量化。在 LLaDA、Dream、Fast-LLM v2 和 Nemotron-Labs-Diffusion 上,SoloQ 在 4-bit 量化下保持精度并超越基于校准的基线;采用 NVFP4 时峰值内存降低最多 2.61 倍,端到端推理加速最多 2.24 倍。

  5. arXiv cs.AI33

    WAMJET:面向 World Action Model 的智能体加速框架

    WAMJET 是一个智能体加速框架,通过为编码智能体配备可复用的优化指导与测量验证工具,加速 World Action Model(WAM)推理。它采用瓶颈驱动流程,让智能体分析推理、修改代码、验证效果并迭代优化加速栈,在六种 WAM、三种编码智能体和两种 GPU 架构上实现最高 9.95x 无损加速,近似与硬件感知优化还能进一步降低延迟且成功率相当。

  6. arXiv cs.AI27

    SpliTEE:用 GPU 辅助 TEE 结合差分隐私实现快速私密 LLM 推理

    SpliTEE 将 LLM 推理拆分到 Intel TDX TEE 与不受信任的 GPU 之间,并用差分隐私保护中间表示,避免加密带来的量化问题。作者对 LLM 推理关键函数做了全局敏感度分析,并推导出掩码与噪声抵消的浮点误差上界。基于 Llama-3.2-3B 和 Qwen3-4B 的实现比全 TDX 推理快近 2 倍,比 Slalom 最多快 43% 且准确率更高。

  7. arXiv cs.AI22

    FedAlign-MoE:面向移动边缘网络数据异构的联邦 MoE 对齐框架

    针对移动边缘设备上 MoE 大语言模型联邦微调中的数据异构问题,研究者提出联邦聚合对齐框架 FedAlign-MoE,通过一致性加权对齐路由分布、分布正则优化本地门控网络,并量化同索引专家的语义一致性以选择性聚合。实验显示,该框架在非 IID 联邦环境下收敛更快、精度更高,且计算轻量、通信高效。

  8. arXiv cs.AI29

    GLANCE:面向视觉语言模型无损推测解码的一次性块草拟

    GLANCE 是一种一次性块草拟方法,可在不改动 VLM 目标模型的前提下实现无损推测解码,其块扩散头在一次前向传播中读取已融合的视觉语言状态并草拟整个 token 块。在固定轮次预算的生产引擎中,GLANCE 解码速度最高达自回归解码的 3.05 倍,在 grounded 任务上平均优于生产级 EAGLE3-VL 头约 11%。代码已开源。

  9. arXiv cs.AI31

    E4:用受限 DSL 实现互联网级服务智能体根因分析

    针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。

  10. arXiv cs.AI20

    X-OPM:面向鲁棒性增强的可解释自动数字片上功耗建模

    X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。

  11. arXiv cs.AI22

    DySCo:面向边缘-云协同 LLM 推理的动态分片与深度同步批处理

    DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。

  12. arXiv cs.AI37

    VisionWeave:让弹性视觉表征成为 MLLM 的原生能力

    VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。

  13. arXiv cs.AI24

    AlignQuant:面向高效 LLM 生成的 Tile 对齐混合精度量化

    AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。

  14. arXiv cs.AI29

    Apple 提出 Stepped MoE:段级路由实现可配置推理复杂度

    Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。