Agent 架构如何从跨层修补走向局部 Owner:一个 Bug 为什么要改五层
复杂 Agent 中一个"搜索摘要被当成正文"的小问题往往要同时修改 Prompt、Runtime、Tool、Evidence、Recovery 五六层,根源是同一事实被多层重复解释、缺乏唯一 owner。
复杂 Agent 中一个"搜索摘要被当成正文"的小问题往往要同时修改 Prompt、Runtime、Tool、Evidence、Recovery 五六层,根源是同一事实被多层重复解释、缺乏唯一 owner。
文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。
Spring AI 2.0.1 的 DefaultToolCallingManager 会完成工具查找、参数规范化、调用、异常转换与 ToolResponseMessage 构造,成功调用后对话历史为 [USER, ASSISTANT, TOOL]。
作者在 GitHub 上找到六个公开仓库,其中四个由 Agent 提交,处理随机失败的门禁测试。一个 Agent 的修复方式是删掉让测试结果变化的 fixture 变量,另一个把重试后通过当作已确认 flaky 的依据。作者自建实验显示,真实 flaky 率 18.3% 的门禁在重试判据下报出 0%,60 轮全绿,真实 61.7% 则被稀释到 26.7%。
Chatbot 的联网能力由 web_search 和 web_fetch 两个工具分工完成:前者按主题返回候选来源的标题、URL 和片段,后者读取已知 URL 并提取可读正文。
用 RabbitMQ 的 topic 交换机把 AI Agent 的 LLM 长任务从 HTTP 请求中解耦:生产者以 routingKey `agent.rag.run` 投递任务,消费者用 bindingKey `agent.rag.#` 绑定 `rag_queue` 队列并独立进程消费。
browser4agent 是一个浏览器扩展加本地小程序,让 Claude Code、Codex、Cursor 等 AI Agent 通过 MCP 或命令行使用用户真实已登录的浏览器,并支持按 URL 匹配的「页面工具」。
基于 DeepAgents 的 createDeepAgent 可组装一个"深度调研助手"多 Agent 系统:主 Agent 任主编负责协调与起草,researcher、analyst、editor 三个子 Agent 分别承担联网调研、eval REPL 数值计算和审稿,通过 subagents、memory、skills 等参数配置团队编制。
架构复杂度本身是成本,Agentic RAG 只在多跳推理场景值得用,且必须同时具备软判据(信息收敛)和硬兜底(max_rounds)才能停。LLM Wiki 走成本前移路线,离线用 LLM 把知识整理成可导航文档,查询量超过盈亏平衡点后比向量 RAG 更划算。
OpenCode 2.0 发布后,插件架构从 V1 Hooks 迁移到 V2 Plugin SDK / Transforms,但按官方文档编写的双版本插件在本地调试时会静默失败。
仓颉棋盘游戏《驿路巡点》从鸿蒙迁移到 iOS 和 Android 时,先尝试仓颉 1.1.3 交叉编译加原生壳方案,只跑通 1 关,且发现 Canvas 在 iOS/Android 的引擎构建中未编入。团队随后转向 CJMP,使用 OpenSDK 0.2.2(内置 cjc 1.1.0),求解器层面 100 关全通,94 关测试在模拟器上完成。
AuthX 正式更名为 GrantForge,并重新做了一遍权限管理系统。原架构已无法承载其想实现的能力,团队在功能持续增加、多角色授权等场景下遇到瓶颈,因此选择重构而非继续叠加功能。
开源多模型数据引擎 SonnetDB 4.0.0 已在 GitHub 发布,基于 C# / .NET 10 构建,采用 MIT 许可证,支持嵌入式运行和独立 Server 部署。本次更新完善了 SQL 与关系数据能力,扩展 CTE 等功能,并强化了部署与恢复边界。该引擎以数据库目录为持久化边界,为时序、关系表、KV、JSON 文档、全文、向量、对象、消息队列和 Graph 提供各自原生语义。
一名 6 年 Go 后端裸辞转 AI,两个月零 offer,复盘发现缺口不在 AI 技术本身,而在业务匹配度、项目深度和面试表达三块底子。他把地产 SaaS 交易链路翻译成幂等、回滚等 AI 岗行话,并在原问答机器人上补超时、重试、trace,让项目能扛住三层追问。补完后 offer 接连到来,最终薪资高于原预期。
某中台 API 网关团队将日均 50 亿次请求、峰值 50000 并发的服务从 500 个平台线程迁移到 JDK 21 虚拟线程,以解决 ulimit 触顶和 P99 延迟飙升至 8 秒的问题。
Spring AI Alibaba Graph 通过 State、Node、Edge、Checkpoint 与 Human-in-the-Loop 等机制,把企业 AI 流程从单次模型调用变成有状态、可路由、可暂停、可恢复的执行过程。
开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。
基于社区镜像 smanx/deepseek-harness:0.2.0-rc.2,可在装了 Docker 的 Linux 上用容器跑起 DeepSeek Harness(@deepseek-ai/dsh)AI Agent,会话存入命名卷 dsh-data,局域网只暴露代理端口 3080。
文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。
Spring AI Alibaba 上一个正式版 v1.1.2.2 发布于 2026 年 3 月 10 日,此后半年无新正式版,但 main 分支仍在提交,v1.1.2.2 后累计合入 137 个提交,以修复和测试为主。
大模型运行依赖算子与 AI Infra 两层支撑:算子是最基本的计算步骤,如 MatMul、ReLU、Softmax,同一算子优化前后速度可差几十倍,FlashAttention 通过重排计算顺序让注意力计算快了好几倍。AI Infra 则覆盖从芯片到上线服务的整套系统,解决跑得起、跑得快、跑得省的问题,常用指标 MFU 能做到一半左右已算不错。
Shaders 发布 WebGPU 特效组件库,提供 200+ 可直接嵌入的组件,覆盖 React、Vue、Svelte、Solid 和 JavaScript,统一 props 并支持 TypeScript 与 SSR。
即时通讯的核心是让不可靠、可离线的多端与服务端就"发生了哪些事、以什么顺序"达成一致,集合与序需分别保证。消息经幂等键去重、分配 seq 定序后落库投递,ACK 仅表示已受理,服务端回显才确认发送成功。同步侧通过会话链与收件箱游标实现跨会话增量拉取,写扩散适合单聊小群,读扩散适合超大群与聊天室。
作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。
作者提出判断 Workflow 与 Agent 的核心标准是下一步由谁决定:开发者提前定义就是 Workflow,模型运行时决定才是 Agent,并给出拔掉大模型测试来验证。
treg 发布一个面向智能体工具的统一注册表,用一个 base URL 和一个 token 即可调用覆盖 SEO、社交趋势、企业与人物信息、广告、抓取、图像与视频生成等数千个端点,按次计费、最低一分钱起,无需向各供应商注册。
作者实测 GitHub Trending 上的 e2e 测试框架(tester-army/e2e),其 agent 步骤验证通过后会被录制,第二次运行直接回放,实测零模型调用、耗时从 3.48 秒降到 309 毫秒。
文章梳理了 2026 年 AI 工程圈新词 Harness Engineering(驾驭工程),其核心公式为 Agent = Model + Harness,即模型之外的系统提示词、工具调用、沙箱环境、编排逻辑、记忆机制与反馈回路等一切。
开源项目 DeskWorlds 的桌面版仅支持 macOS,作者用 ZCode 拆解后发现鱼缸场景本身是运行在浏览器里的 Three.js + WebGL2 3D 世界,与 macOS 绑定的只是最外层壁纸宿主。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,保持基础 VLA 模型完全冻结,让剪枝后上下文产生的动作与全上下文教师模型保持一致。在 LIBERO 和真实机器人操作任务上,该方法最多剪掉 87.5% 的视觉 token,计算量降低最多 75%,推理提速 1.5 倍,性能仍具竞争力。代码已开源。
CtrlCache 是一个免训练的控制感知缓存框架,通过动作感知调度与刷新策略,将视频块标记为初始、过渡、转向或稳态,并在选定的去噪步骤复用 Transformer 残差,同时用频率混合历史先验引导利用低频结构。
研究者提出 BASA,一种后端无关的稀疏注意力机制,用移位局部窗口注意力替代视觉自注意力,通过跨 DiT 块的结构化窗口移位实现全局信息交换,消除窗口边界造成的网格状伪影。BASA 无需定制算子即可部署在现有注意力后端,在 FLUX 上实测加速超过理论估计的 90%,在 Wan 上实现 4.52 倍注意力加速,并保持有竞争力的生成质量。
TSRN-RTVD 是一个实时视频去模糊系统,通过显式重建曝光期间的相机运动轨迹来引导画面复原。该系统在单块消费级 GPU 上以 30 FPS 运行,在 GoPro 数据集上达到 30.08 dB PSNR,并可在消费设备上实时并排展示模糊输入与去模糊输出及恢复的相机轨迹。
AgSpec 是一个面向编码智能体流水线的检索式投机解码框架,从会话、工作区和全局语料中检索,并按智能体输出格式索引已打开文件,同时用离线测得的长度上限约束草稿长度、再根据验证反馈在线调整。
SharedKV-BT 让行为树每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并将选中决策交给独立执行系统。在机器人操作、移动导航和计算机使用三类任务上,其类型化决策比提示词匹配的自回归解码快 2.36-4.15 倍;操作任务中节点本地 Shared-KV 将联合决策准确率从 75% 提升至 94%,闭环成功率从 0% 提升至 60%。
研究者提出 AID(AI Infrastructure Dynamics)框架,用于描述物理、计算、网络与服务耦合过程中的 AI 推理基础设施学习问题,支持结构化可变状态、异步观测、多物理时间尺度和随服务变化的需求。该框架区分了现有策略下的预测表示与动作变化下保持服务结果的表示,并给出观测无法区分模型时预测误差下界及精确受控状态约简的充分条件两项分析结果。
AEGIS 是一个面向共享多 GPU 服务器的运行时调度系统,通过将内存可行性、放置后观测、运行时压力过滤、放置与 OOM 感知恢复整合进单一调度循环,实现深度学习训练工作负载的可控共置。
DLoop 是一种循环式投机解码方法,在验证前自适应执行多轮起草,让草稿模型在保持置信时持续生成 token,再统一验证所有累积的草稿 token。该方法在 EAGLE-3、DFlash、Domino、DSpark 及多 token 预测模块上把实际加速提升 5% 至 41%,同时保持无损解码。配套的循环感知训练让草稿模型接触未验证草稿 token 的自身隐藏状态,从而在额外起草阶段保持可靠。
LionMuon 提出每 P 次迭代执行一次 Muon 谱步、其间执行 Lion 符号步,两者共享单一双 EMA 动量缓冲区,使 Muon 的计算与通信开销每 P 步仅支付一次,优化器状态仅为 AdamW 的一半。
KVCMAS 是一个在线 KV cache 修正框架,用紧凑低秩状态表示跨智能体缓存偏差,并沿智能体工作流无缝串联修正,无需额外参考预填充,同时保留精确的首个智能体缓存。