跳到正文
今天10月7日周三77 条
  1. arXiv cs.AI31

    E4:用受限 DSL 实现互联网级服务智能体根因分析

    针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。

  2. arXiv cs.AI20

    X-OPM:面向鲁棒性增强的可解释自动数字片上功耗建模

    X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。

  3. arXiv cs.AI22

    DySCo:面向边缘-云协同 LLM 推理的动态分片与深度同步批处理

    DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。

  4. arXiv cs.AI37

    VisionWeave:让弹性视觉表征成为 MLLM 的原生能力

    VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。

  5. arXiv cs.AI24

    AlignQuant:面向高效 LLM 生成的 Tile 对齐混合精度量化

    AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。

  6. arXiv cs.AI29

    Apple 提出 Stepped MoE:段级路由实现可配置推理复杂度

    Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。

  7. arXiv cs.AI22

    FlexiFlow:基于多臂老虎机的 ML 工作流模型动态切换

    FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。

  8. arXiv cs.AI23

    SAFESHIELD:面向小语言模型部署时安全的决策组织框架

    SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。

  9. arXiv cs.AI22

    OSFP4:面向 NVFP4 量化的对角平滑与块缩放联合优化

    研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。

  10. arXiv cs.AI26

    BluffJAX:JAX 中的对抗性不完美信息博弈开源套件

    BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。

  11. arXiv cs.AI22

    VALSE:面向大语言模型高效推理的垂直自适应层跳过方法

    VALSE 是一种按样本、非连续的层跳过方法,用轻量难度估计器从前几层为每个输入打分,再通过逐层门控选择性跳过冗余层,包括任意中间层而保留更深层,只为每个输入激活必要深度。论文同时给出期望 FLOPs 闭式公式、跳层模型函数空间为全层函数空间真子集的证明,以及与 MoE 架构的结构对偶关系,可行性已在原型规模初步验证。

  12. arXiv cs.AI22

    Trajectory-Retrieval Speculative Decoding:模型自身历史何时有用?

    研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。

  13. arXiv cs.AI32

    MemMux:面向并行编码智能体集群的运行时验证与资源归属

    MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。

  14. AWS Machine Learning Blog22

    Amazon SageMaker HyperPod 管理与治理最佳实践

    Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 连接项目后,团队可在项目工作区启动训练与微调工作负载,同时由基础设施团队继续通过 SageMaker AI 接口和 API 管理集群。文章提出组织、项目、集群、工作负载四层控制模型,并说明如何跨层设计身份、容量与可观测性策略,在共享加速器算力时保留底层治理控制。

10月6日周二
  1. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。

  2. AWS Machine Learning Blog26

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。