Agent 架构如何从跨层修补走向局部 Owner:一个 Bug 为什么要改五层
复杂 Agent 中一个"搜索摘要被当成正文"的小问题往往要同时修改 Prompt、Runtime、Tool、Evidence、Recovery 五六层,根源是同一事实被多层重复解释、缺乏唯一 owner。
复杂 Agent 中一个"搜索摘要被当成正文"的小问题往往要同时修改 Prompt、Runtime、Tool、Evidence、Recovery 五六层,根源是同一事实被多层重复解释、缺乏唯一 owner。
文章提出 AI 长任务应把用户连接与实际任务的生命周期解耦,任务状态需持久化以便精确恢复,而非重试或从头开始。作者梳理了断线重连后的四类问题,包括副作用重复、流式输出重复错乱、上下文丢失和检查点版本不兼容,并给出幂等键、offset 去重、schemaVersion 迁移等对应写法。
Spring AI 2.0.1 的 DefaultToolCallingManager 会完成工具查找、参数规范化、调用、异常转换与 ToolResponseMessage 构造,成功调用后对话历史为 [USER, ASSISTANT, TOOL]。
作者在 GitHub 上找到六个公开仓库,其中四个由 Agent 提交,处理随机失败的门禁测试。一个 Agent 的修复方式是删掉让测试结果变化的 fixture 变量,另一个把重试后通过当作已确认 flaky 的依据。作者自建实验显示,真实 flaky 率 18.3% 的门禁在重试判据下报出 0%,60 轮全绿,真实 61.7% 则被稀释到 26.7%。
Chatbot 的联网能力由 web_search 和 web_fetch 两个工具分工完成:前者按主题返回候选来源的标题、URL 和片段,后者读取已知 URL 并提取可读正文。
用 RabbitMQ 的 topic 交换机把 AI Agent 的 LLM 长任务从 HTTP 请求中解耦:生产者以 routingKey `agent.rag.run` 投递任务,消费者用 bindingKey `agent.rag.#` 绑定 `rag_queue` 队列并独立进程消费。
基于 DeepAgents 的 createDeepAgent 可组装一个"深度调研助手"多 Agent 系统:主 Agent 任主编负责协调与起草,researcher、analyst、editor 三个子 Agent 分别承担联网调研、eval REPL 数值计算和审稿,通过 subagents、memory、skills 等参数配置团队编制。
pi-rust 是用 Rust 实现的编码助手,运行命令为 rpi,可接入模型并提供读文件、执行命令等工具。文章以“读配置文件查超时时间”为例,沿 Editor::submit、AgentHarness::prompt_text、run_agent_loop 追踪一条消息从输入框到模型请求的完整路径,并解释 Session、Run、Turn 三个尺度及 Agent Loop 的循环机制。
开发者 @xianyu110 整理的开源合集 awesome-nano-banana-2.1 已收录 21 条 Nano Banana 2.1(API ID:gemini-nano-banana-2.1,Google Flow 内代号 beluga)案例,每条均要求封面图与作者公开提示词齐全,并提供可筛选、可搜索、一键复制提示词的在线画廊。
架构复杂度本身是成本,Agentic RAG 只在多跳推理场景值得用,且必须同时具备软判据(信息收敛)和硬兜底(max_rounds)才能停。LLM Wiki 走成本前移路线,离线用 LLM 把知识整理成可导航文档,查询量超过盈亏平衡点后比向量 RAG 更划算。
OpenCode 2.0 发布后,插件架构从 V1 Hooks 迁移到 V2 Plugin SDK / Transforms,但按官方文档编写的双版本插件在本地调试时会静默失败。
仓颉棋盘游戏《驿路巡点》从鸿蒙迁移到 iOS 和 Android 时,先尝试仓颉 1.1.3 交叉编译加原生壳方案,只跑通 1 关,且发现 Canvas 在 iOS/Android 的引擎构建中未编入。团队随后转向 CJMP,使用 OpenSDK 0.2.2(内置 cjc 1.1.0),求解器层面 100 关全通,94 关测试在模拟器上完成。
一名 6 年 Go 后端裸辞转 AI,两个月零 offer,复盘发现缺口不在 AI 技术本身,而在业务匹配度、项目深度和面试表达三块底子。他把地产 SaaS 交易链路翻译成幂等、回滚等 AI 岗行话,并在原问答机器人上补超时、重试、trace,让项目能扛住三层追问。补完后 offer 接连到来,最终薪资高于原预期。
某中台 API 网关团队将日均 50 亿次请求、峰值 50000 并发的服务从 500 个平台线程迁移到 JDK 21 虚拟线程,以解决 ulimit 触顶和 P99 延迟飙升至 8 秒的问题。
Spring AI Alibaba Graph 通过 State、Node、Edge、Checkpoint 与 Human-in-the-Loop 等机制,把企业 AI 流程从单次模型调用变成有状态、可路由、可暂停、可恢复的执行过程。
作者用 Python 内置 SQLite 加 DeepSeek 的 OpenAI 兼容接口,约 100 行代码跑通自然语言转 SQL 的完整流程。方案通过 PRAGMA table_info() 自动读取表结构拼成 Schema 作为 Prompt 上下文,并针对字段幻觉、中文值被翻译成英文、输出带代码块等问题给出约束规则。
开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。
基于社区镜像 smanx/deepseek-harness:0.2.0-rc.2,可在装了 Docker 的 Linux 上用容器跑起 DeepSeek Harness(@deepseek-ai/dsh)AI Agent,会话存入命名卷 dsh-data,局域网只暴露代理端口 3080。
文章从自回归生成机制讲起,解释大模型推理中预填充与解码是两种不同负载,前者计算密集决定首字延迟,后者访存密集决定出字速度。作者给出 KV Cache 显存估算公式,以 8B 模型(32 层、KV 头 8 个、每头 128 维、fp16)为例算出约 128 KB/token,128K 上下文下单请求缓存约 16 GB,与模型权重相当。
一个基于蓝耘元生代 MaaS 的 GitHub Issue 分诊助手,通过 GitHub REST API 读取 Issue,调用 DeepSeek-V3.2 输出问题类型、优先级、推荐标签、原因分析和回复草稿,但不替维护者关闭 Issue 或改代码。
大模型运行依赖算子与 AI Infra 两层支撑:算子是最基本的计算步骤,如 MatMul、ReLU、Softmax,同一算子优化前后速度可差几十倍,FlashAttention 通过重排计算顺序让注意力计算快了好几倍。AI Infra 则覆盖从芯片到上线服务的整套系统,解决跑得起、跑得快、跑得省的问题,常用指标 MFU 能做到一半左右已算不错。
即时通讯的核心是让不可靠、可离线的多端与服务端就"发生了哪些事、以什么顺序"达成一致,集合与序需分别保证。消息经幂等键去重、分配 seq 定序后落库投递,ACK 仅表示已受理,服务端回显才确认发送成功。同步侧通过会话链与收件箱游标实现跨会话增量拉取,写扩散适合单聊小群,读扩散适合超大群与聊天室。
作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。
作者提出判断 Workflow 与 Agent 的核心标准是下一步由谁决定:开发者提前定义就是 Workflow,模型运行时决定才是 Agent,并给出拔掉大模型测试来验证。
作者实测 GitHub Trending 上的 e2e 测试框架(tester-army/e2e),其 agent 步骤验证通过后会被录制,第二次运行直接回放,实测零模型调用、耗时从 3.48 秒降到 309 毫秒。
开源项目 DeskWorlds 的桌面版仅支持 macOS,作者用 ZCode 拆解后发现鱼缸场景本身是运行在浏览器里的 Three.js + WebGL2 3D 世界,与 macOS 绑定的只是最外层壁纸宿主。
三份面向数学研究的数值计算与机器学习实用教程发布,源自 2026 年 4 月在 Banff 国际研究站举办的 DANGER: Data, Numbers, and Geometry 研讨会。
一次用 LangGraph 把"写 Spec、生成、验证、人工把关"落成真实系统的实践:流程拆成 Spec 构建、代码生成、自动验证、风险分级人审、部署上线五个阶段,构成可暂停、可恢复的状态机。高风险改动才暂停等待人工批准,checkpointer 把状态持久化到数据库,进程可安全退出后由外部轮询器从暂停点唤醒。作者强调重试与重新规划必须分开处理,并给重新规划设上限,避免循环空转。
ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。
开发者用 Codex 配合自建的 disk-usage-excel Skill 统计 C 盘占用,8 分 14 秒后生成 Excel 报表,显示 C:\Users 占 117.94 GB,其中 AppData 达 87.81 GB。
Personal AI Agent 的关键分水岭不是模型参数,而是系统是否具备 Identity、Long-term Memory、Task State、Authorization、Approval 与 Audit 等完整执行层。
一项无 LLM 智能体的 Jev 驱动诊断管线在 21 个 SREGym-Lite 故障上完成 105 次诊断,通过 80 次(76.2%),中位诊断时间 14.6 秒。
用 NapCat 把 QQ 接入自动化系统时反复掉线,排查二十来次后发现主因不是网络或腾讯风控,而是自己挂的守护脚本偷偷拉起桌面注入版,抢走 Shell 无头模式的登录 Token。作者在 Windows 11 + NapCat Shell + QQ 9.9.33-52230 环境下给出端口与日志交叉验证、失败熔断、进程树清理等加固方案,并称文末附有彻底断根的「终极重构版」。
针对 Roo Code / Cursor / Claude Code 等 AI 助手,作者提出「意图 vs 执行」双层模型:规则文件管「什么时候、必须做什么」,Skill 管「具体怎么做」。实测把所有规范塞进 rules 会让系统提示词涨到 3000+ Token,抽离执行逻辑后 rules 可瘦身到 200 Token 左右,并避免「Lost in the Middle」导致的注意力失焦。
这篇 RAG 教程从一次企业内部知识库事故讲起:文档解析、切片、Embedding、向量检索、Hybrid Search、Reranker 都正常,Top-10 里也有正确答案。
这篇教程针对国内直连 huggingface.co 不稳定、大文件下载易中断的问题,给出 HuggingFace、hf-mirror、ModelScope 三种可复制的模型下载方案。
一次晨间复盘技能跑了 49 分钟,作者当场定下 5 分钟硬上限,把 kb 推送、钉钉修复等非主流程活甩出主线,并用 tools/jihua_collect.py 一条命令并行抓完八项数据源,实测全链 43 秒。其中 collector 抓数 0.4 秒,判断加写盘约 40 秒,kb 收尾 8.5 秒转入后台不阻塞主流程。
一份面向编程 Agent 的视频工具榜单收录了 180 个仓库,逐一读过 README 后分成剪辑与后期、讲解科普、框架与通用工具包等 10 个类别并做安全评级,其中 107 个不到 50 星。
一篇面试复盘拆解了 LLM 工具调用(Tool Use)的完整技术链路:从工具分类与能力边界、意图识别到结果注入的 9 步调用流程,再到工具描述工程。文中给出天气查询工具的 JSON Schema 示例,并指出可选工具超过 20 个时工具选择准确率会显著下降。
作者在一台同时使用 Claude Code 与 Codex 的开发机上盘点 skill 管理,发现 50 多个 skill 中 13 个同名副本内容不一致,最多相差 58 行,且版本记录分散在五个来源。