E4:用受限 DSL 实现互联网级服务智能体根因分析
针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。
针对互联网级服务故障排查,研究者提出智能体系统 E4,采用"受限创造力"范式,不让 LLM 智能体写任意代码或生成任意回复,而是通过一个无循环数据流程序的受限 DSL 生成响应。在合成与真实混合负载上,E4 准确率最高提升 62%,成本最高降低 12 倍,同时提供更可解释的响应。
X-OPM 提出一种可解释的数字片上功耗建模框架,用树模型捕捉特征交互、线性模型完成预测,并引入 human-in-the-loop 流程平衡精度与建模成本。在商用 C906 向量处理器上,采样窗口小于 8 cycles 时全部工作负载均达 R² > 0.93,而 APOLLO、COBIT 和标准 MLP 均无法在所有测试用例上泛化。
NVIDIA 提出 NeMo-DCR(Delta-Compressed Refit),只传输权重变化量却保持比特精确,接收端得到与全量重配完全相同的参数和 buffer 位。
针对视觉世界模型决策时动作搜索规划预算过大、迭代规划器重复编码不变上下文的问题,研究者提出部署框架 SufficientPlan,无需修改预训练世界模型或规划器更新。
DySCo 是一个边缘-云协同 LLM 推理运行时,通过保持 KV 缓存本地化并引入 dyForward 层范围执行器,让边缘设备无需重载权重即可运行可配置的连续层范围。其深度同步批处理(DSB)将异构请求推进到最深切分点并批处理公共后缀,在平均并发为 8 时吞吐量较 FIFO 提升 275%、较精确匹配批处理提升 48%、较轮询交错提升 79%,同时降低平均每会话延迟。
VisionWeave 通过门控空间池化器与粒度路由器,让 MLLM 端到端学习按内容自适应分配视觉 token 粒度。基于 Qwen3.8-27B,它在八个基准上平均节省 43.0% token 并保留 98.9% 原生性能,而固定 50% 节省目标的 token 剪枝基线仅保留 88%。部署于 SGLang 后吞吐提升 2.3 倍,平均 TTFT 降低 54.4%、TPOT 降低 60.6%。
ReFold 是一种免训练的渲染层方法,可在保留底层交互历史的同时压缩模型渲染的上下文,无需辅助预测器即可去除轮间冗余,且每次删除严格可逆。在五个长程基准和两个前沿 LLM 上,它将 token 消耗降低最多 2.5 倍、每会话 KV-cache 内存减半,且不降低任务成功率。
研究者提出 Dev-Primitives(开发原语),把仓库组件与其常驻 LLM 配对,使其具备自然语言推理、组件间通信和局部自我修改能力,并据此构建 Harness Engineering 框架 HERMES。
机器学习编译器 Cleave 通过符号化解耦,将代数变换搜索与算子调度分离,在常见 LLM 子图上生成的 kernel 比最优基线最高快 2.8 倍(平均 1.6 倍),编译时间比 Mirage 平均减少 5.9 倍。
AlignQuant 是一种训练后量化方法,以 GPU 兼容的二维权重 tile 作为精度分配、紧凑存储与执行的统一单元,让精度在输出通道内跟随敏感度。在 4 个 3B 至 14B 参数的 LLM 上,它相比 BF16 实现最高 2.50 倍生成加速并保持模型质量,评测覆盖 3 种 GPU 和最高 64K token 上下文。实现已开源。
Apple 提出 Stepped MoE 框架,将弹性结构与稀疏门控架构结合,让单一模型可在 1、2、3、4 billion 参数间灵活切换,并保持输入自适应路由。该模型在知识密集型基准上比同规模稠密模型准确率高 2-5%,延迟与稠密模型相当,同时通过共享参数节省设备磁盘空间,适配端侧推理的 DRAM 与算力限制。
RelayMoE 是一种基于环结构的 MoE 执行模型,通过让专家权重或 token 在环上流转并本地计算,避免构建完整的 top-k 扩展调度缓冲区。在 30B–57B 生产级 MoE 模型上,单层实验较 Megatron-LM 平均提速 2 倍,全模型训练吞吐最高提升 2.02 倍,可训练序列长度最高扩展 2.85 倍。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换到备选模型,通过多臂老虎机方法对模型进行排序,综合考虑模型运行时间、通过用户自定义断言的概率以及 ML 工作流的计算结构。实验显示,切换模型可将工作流准确率提升最高 23%,运行时复用中间结果相比顺序执行工作流还能带来 48% 的效率提升。
SAFESHIELD 是面向小语言模型的部署时安全系统,将安全决策组织为准入、路由、证据、放行四类职责,并把已提交决策记录为可审计的 Decision Traces。协调消融实验显示,移除准入门控会显著增加误放行,而放行决策缺少上游证据时准确率从 96.0% 降至 69.5%,表明部署时安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
TraceDSE 是一种智能体设计空间探索流程,用于异构边缘 SoC 上 AI 推理的工作负载映射与 PU 配置联合选择,通过 LLM 提议者-批评者循环并借助系统执行轨迹反馈进行迭代优化。
T-CCL 是一个基于 Tensor Memory Accelerator(TMA)的节点内集合通信库,将数据搬运与归约操作卸载到 TMA,以流水线式异步 TMA 操作执行集合通信,在保持高带宽的同时降低 SM 资源占用。
SchemaFill 通过槽位并行推测解码加速 LLM 工具调用,在 Glaive 和 BFCL 上端到端吞吐量最高提升 4.05 倍。该框架将多个字段和调用的候选值并发生成后拼接,由目标模型在实际输出前缀下验证,仅提交通过验证的 token,候选不一致时由目标模型提供修正。代码已开源。
研究者提出免训练方法 MaskAhead,用单一掩码查询排序机制同时完成块扩散语言模型的 KV 选择与淘汰,当前块掩码指导选择、后续掩码块探测指导淘汰。
针对并行多智能体系统常比单智能体更慢的问题,研究者提出 SquidAgent,将并行决策标准从难以校准的墙钟时间改为预测输出 token 数,并通过从编排者会话直接 fork 每个 worker 消除重探索成本、用预生成共享约定块把对齐成本前置为有界开销。
研究者提出 NVFP4 量化方案 OSFP4,对每个线性投影使用对角平滑矩阵,在 NVFP4 下联合优化平滑项与块缩放以最小化矩阵乘量化误差,并兼容 round-to-nearest 与 GPTQ 式逐次干扰消除。实验显示 OSFP4 在对应量化设置下取得所评估方案中最高的平均精度,同时保留约 94-97% 的厂商 NVFP4 prefill 吞吐,代码已开源。
STEPGATE 是一种不确定性感知的步骤级交接框架,对本地小语言模型的每个动作打分,将困难步骤选择性升级到更强模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%。
BluffJAX 是一个基于 JAX 的开源对抗性不完美信息博弈套件,包含 Texas Hold'Em Poker、Kuhn Poker 等经典基准,以及此前未被强化学习研究过的 Bluff、Stud Poker 和 Kemps。其在单 GPU 和多 GPU 设置下实现每秒数亿样本的吞吐量扩展,并提供了强化学习、树搜索和博弈求解算法的基线结果。
VALSE 是一种按样本、非连续的层跳过方法,用轻量难度估计器从前几层为每个输入打分,再通过逐层门控选择性跳过冗余层,包括任意中间层而保留更深层,只为每个输入激活必要深度。论文同时给出期望 FLOPs 闭式公式、跳层模型函数空间为全层函数空间真子集的证明,以及与 MoE 架构的结构对偶关系,可行性已在原型规模初步验证。
研究者发布 LOGIC,一个用于航空航天电气设计变更影响分析的 LLM 基准与评估框架,包含 168 个场景(144 个选择案例、24 个弃答案例),让本地部署模型先在确定性候选变更清单中完成意图定位,再经类型化电气追溯图传播。
研究提出 Trajectory-Local Adaptive Retrieval(TLAR),从当前推理轨迹中检索近似匹配的续写,并结合近期验证结果自适应调整检索激活与候选宽度。TLAR 将检索续写与模型生成草稿合并到共享候选树,通过精确验证保持目标模型输出分布。在代码调试、数学和开放式写作任务中,TLAR 结合强检索基线在相同验证预算下提升 token 接受率,并较草稿模型基线提高端到端吞吐。
MemMux 是一个本地运行时,为并行编码智能体集群提供可检查的资源治理信号,包括按智能体归属、完整回收、逃逸进程可见性等。在 Linux 内存预算约束下,MemMux 将集群控制在 7.5 GiB 且零 swap,而未治理工具会超出预算 2 倍并溢出约 2 GiB 到 swap;它还能 100% 回收终止智能体的进程子树,并检测出全部 10 个逃逸子进程。
Cascadia 在十一台 Intel Core Ultra X7 358H AI PC 上常驻运行 975B 总参数、41B 激活参数的 MoE 模型 Inkling,每台配 64 GB 内存、Arc B390 核显与千兆以太网。
一篇 arXiv 论文提出面向生成式 AI 的生产级内容抽取系统,将内容抽取作为独立生命周期阶段,包含选择性 OCR 路由、基于参考的抽取评分器、确定性结构感知父子分块器和只读检索评估器。
离线 AI 模块工作流发布语音优先的完全离线部署方案,包含模块化架构、低成本硬件 BOM 和面向 2-5B 参数指令微调模型的可复现量化与基准测试流程。
AegisFlow 是一个基于 LLM 的多智能体框架,通过 Watchdog 与 Repair 智能体自动生成、测试并部署代码补丁,在五类常见故障场景下将 MTTR 从平均 170 分钟降至 3.2 分钟,补丁成功率达 92%。
FluidPD 是一个面向 SLO 的 P/D 分离 LLM 服务系统,通过 FluidToken 将部分预填充计算卸载到空闲的解码 worker 以应对瞬时失衡,并用 FluidRole 原地切换运行中 worker 的预填充/解码角色以应对持续失衡,避免模型重载与引擎重启。
Text2Dashboard 是面向 DataBrain 的原型系统,通过可安装 Codex 插件与独立 Agent Runtime,将自然语言分析请求转化为可审查的仪表盘,由确定性软件控制执行并记录状态变更。
基于开源智能体系统 OpenClaw 和 Amazon Bedrock AgentCore runtime,可构建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为持久知识。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可搭建一套语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
Amazon SageMaker Studio 新增在 UI 中直接创建和管理 HyperPod EKS 集群上 SageMaker Spaces 的能力,数据科学家无需 CLI 或 kubectl 即可启动 JupyterLab 和 Code Editor 环境。
Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 连接项目后,团队可在项目工作区启动训练与微调工作负载,同时由基础设施团队继续通过 SageMaker AI 接口和 API 管理集群。文章提出组织、项目、集群、工作负载四层控制模型,并说明如何跨层设计身份、容量与可观测性策略,在共享加速器算力时保留底层治理控制。
AWS 发文解读国际标准 ISO/IEC 42005:2025,说明如何将 AI 系统影响评估整合进企业风险管理体系。该标准覆盖评估全生命周期,Annex D 用于与既有 IT 影响评估流程协同去重,Annex E 提供独立实施模板,并给出轻量级 triage 分类以判断是否需要完整评估。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。