Agent 系统工程 09:Agent 的可靠性怎么测?成功率、恢复能力与成本
Agent 可靠性评测需区分 pass@k(k 次至少成功一次)与 pass^k(k 次全部成功)两类指标,前者适合可挑候选的场景,后者衡量重复交付的稳定性。故障恢复应单独建回归集,按故障类型和位置组织用例,不能与自然任务混算统一成功率。成本与延迟须随结果一并记录,包括输入输出 token、工具调用数、实际费用和失败尝试消耗的资源。
Agent 可靠性评测需区分 pass@k(k 次至少成功一次)与 pass^k(k 次全部成功)两类指标,前者适合可挑候选的场景,后者衡量重复交付的稳定性。故障恢复应单独建回归集,按故障类型和位置组织用例,不能与自然任务混算统一成功率。成本与延迟须随结果一并记录,包括输入输出 token、工具调用数、实际费用和失败尝试消耗的资源。
作者以宠物全生命周期管理 App 为例,演示如何用 Claude Code 的 Memory、Rules、Skills、Commands、MCP、SubAgents、Hooks、Headless、Agent SDK、Plugins 十项能力从零搭建项目。
Agent Skills 的工程价值来自可发现、可校验、可渐进加载的约定,而非把系统提示词拆成一个 Markdown 文件。
Mindcraft 把作者运行 3 个月的 AI 工作台经验提炼为可复用模式集,涵盖技能生命周期、结构完整性、验证体系、需求到落地、协调协议 5 个维度。其中结构完整性维度提供 1,600 行 Python 脚本,基于 11 天实际数据实现 6 个数据模块全部纳管、平均索引健康度 93%、154 个数据点 89% 验证通过率、0 次手动索引编辑。
ReAct 智能体是一种将思维链(CoT)推理与外部工具调用相结合的 AI 智能体框架,通过"思考、行动、观察"循环交替运行,让大语言模型动态调整任务处理方案。该框架最早在 ReAct 原始论文中提出,可减少模型幻觉并提升输出准确性,其效果高度依赖核心大语言模型的推理与指令遵循能力。
从零构建 Agent 系列第 10 章讲解如何为 Agent 增加会话持久化:退出前把 agent.state.messages 中的完整消息按顺序写入 JSONL 文件,重启后读回并交给新 Agent 的 initialState.messages,使其能基于原历史继续提问。
LangChain 的 createMiddleware 中间件可挂载 beforeAgent、beforeModel、afterModel、afterAgent 四个钩子,并通过 stateSchema 声明自己的状态字段,如 modelCallCount 记录模型调用次数。
一位开发者将 AI 客服链路迁到 TypeScript 5.7 后,线上问题明显减少,核心是用类型收窄加 schema 校验、satisfies 固定工具协议、可判别联合类型建模流式事件,分别解决模型返回结构不稳定、Tool Calling 字段漂移和流式响应状态混乱三类边界问题。
Meta 旗下个人智能体 Muse 冲上美国 App Store 生产力效率榜第一名,获超 10 万条评价、评分 4.9,并同步在 GitHub 开源 Muse Gadget SDK,提供针对 ESP32 与 Linux 的设备端源码与通信固件。
作者开源了 kshell,一个用 Go 1.23+、Wails v2、React 19 和 Bubbletea 构建的 AI 编程 CLI 统一工作台,自动扫描本机已装工具并汇总其会话、工作区、终端与远程服务器,支持 Windows、macOS、Linux,MIT 协议,当前版本 v0.1.3。
作者用 Claude Opus 5.5 生成动画代码、再由渲染工具合成视频,跑通了从口播稿到成片的全流程。做法是先由导演 Skill 完成分镜设计,再搭配主题模板 Skill 交给 Claude 生成固定风格动画,满意后封装成模板 Skill 批量产出。目前未放开变现,核心原因是剪辑一个视频的 token 成本太高。
开发者用一部安卓手机通过 SSH 登录无桌面的 Linux 服务器,让终端里的 Agent 完成编码、构建、安装与测试,再切到 AScrcpy 查看并操作服务器模拟器上的画面完成验收。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步工作流并跨会话保留上下文。新版编排系统协调智能体调用共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能从聊天提示词直接生成演示文稿、仪表盘和简单应用。
Reflection 发布 Beam,一个面向编码、智能体和科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 协议在本月开放。
一篇 LangChain 教程把检索、记忆、工具调用、流式输出和回调可观测五个零件,用 Runnable 和竖线 `|` 拼成一个可运行的电商客服助手,并用免 key 脚本完整跑通。
一篇观点文章认为,在 LLM 能快速写代码之后,Common Lisp 因读写期、编译期与运行期无实质区分而成为最佳编程语言:其基于镜像的运行方式可即时替换函数、出错时进入调试器而非崩溃,便于 LLM 修复并继续运行。作者称自己用 Common Lisp 写的应用比 Python 版本短约六到七倍,代码更少意味着 token 更少、更易放进 LLM 上下文窗口。
手写 Claude Code 复刻项目 codeAgent 在并行工具调用回喂时踩坑:按 OpenAI 习惯逐条回喂 tool 结果,切到 Anthropic 端点直接 400,因为 Anthropic 要求所有 tool_result 装在同一条 user 消息里且不允许两条 user 消息相邻。
dots 是一个 3 天斩获 2.4K Star 的 Web AI Agent 项目,核心卖点是对 Firefox 引擎做 C++ 源码补丁,使指纹在引擎层生成而非 JS 注入,从而规避反爬检测。
针对 Agent 流式输出中 Nginx 缓冲截留、多节点 SSE 连接孤岛、事件类型混乱三大生产环境问题,该方案基于 Spring Boot 3 的 SseEmitter 构建会话管理器,配合 Redis Pub/Sub 实现跨集群节点的事件广播。
arXiv 论文 AgentLens 将 1,136 条通过轨迹分为 Ideal(20.2%)、Solid(69.1%)和 Lucky(10.7%)三档,Lucky Pass 在八个模型后端间跨度达 46 倍,而 pass rate 排名与过程质量排名全部不一致。
作者开源了一个 MCP server,让 Claude Desktop、Cursor、Cline 等 MCP 宿主里的 AI 以可见形象进入其浏览器多人 3D 世界,真人可在 30m 内看到 AI 走动、说话并与之对话。
一位不懂编程的物料计划人员用 WorkBuddy(豆包桌面端)通过9轮对话,把每天40分钟的手工导出汇总流程做成双击一次38秒完成的自动化工具,全程未写一行代码。文中给出提需求四层法(目的、步骤、文件与规则、边界与例外)、报错三步法(截图、复制原文、说明操作)和三条底线(先备份、交代禁区、密码别写在聊天里),并附可直接填空的模板。
Cloudflare 于 9 月 28 日发布全新命令行工具 cf,覆盖其接近 3000 项公开 API 操作,并支持用自然语言搜索命令、默认返回 JSON。官方统计显示,2026 年 3 月 AI Agent 已贡献 Wrangler 四分之一使用量,到 cf 发布前一周升至 48%。
文章以 Codex Rust 版 commit 2685e3a4 源码为证据,梳理编程 Agent 的提示词注入面,包括 README、代码注释、测试 fixture、commit/PR 文本、issue 正文、依赖包、MCP 工具返回和 web 搜索结果八个入口。
一个示例工程拆解了 AI Skill 的完整落地路径:把会议纪要生成固化为 SKILL.md,靠 YAML 头部的 name 和 description 决定技能是否被触发,正文写工作流程与输出模板。
LangChain Agent 开发中可用五种方式定义工具:@tool 基础装饰器、@tool 加 parse_docstring、StructuredTool、继承 BaseTool 以及 Runnable 转 Tool,分别对应快速原型、多参数规范工具、存量函数复用、生产复杂工具和已有 Runnable 链路复用。
一份实践思路指出,用 Ollama 等工具在本机部署 AI Agent,可让代码、文档、日志全部留在本地,16GB 内存即可流畅运行 7B 级别量化模型,且开源模型一次部署长期复用、不按次计费。
Anthropic 的 Felix Rieseberg 表示,新版 Cowork 将模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在云端做模型推理、但把 Anthropic 提供的 VM 装到用户电脑上执行工具调用,用户不满其磁盘、电池和性能开销,以及合上笔记本就中断工作。当 VM 需要访问用户设备上的文件时,由桌面应用负责该文件访问的工具调用。
gstack 是一个开源工具集,通过 23 个结构化 AI 角色把 Claude Code 转化为虚拟工程团队,覆盖产品设计到部署的全流程。
Agency Agents 是一套支持多平台、跨工具安装的 AI 智能体协作系统,包含 230 余个专业化角色,覆盖工程、营销、销售、运营等 8 大部门。它提供针对 Claude Code、Cursor、GitHub Copilot、Gemini CLI、OpenCode、Kimi Code 等 14 种 AI 编码助手的安装脚本,可通过一行命令部署并交互式选择工具与代理群组。
Agency Agents 是一个跨平台桌面应用与脚本套件,可将超过 230 个专业化 AI 智能体安装到 Claude Code、Cursor、GitHub Copilot、Gemini CLI 等主流编程工具中。
Wavestone 四位研究者发布 83 页论文《Harness Engineering》,逐行阅读 Claude Code、Codex CLI、Gemini CLI。
Agent-Reach 是一个开源项目,作为能力层替 agent 选型、安装和体检各平台读取工具,官方列出网页、X、Reddit、YouTube、B 站、小红书等 16 个平台,今年 2 月在 GitHub 建仓,现接近 9 万星。
GitHub 日榜 2026-10-06 显示,Swift 工具 RemoveMacAI 以 24h +1,577 Star 登顶,可关闭 macOS 27 的 Apple Intelligence 并删除其下载模型。
文章围绕多租户 LLM 应用的 Prompt 隔离问题,提出从 Layer 0 平台级 System Prompt 到用户输入的四层 Prompt 架构,并给出 Jinja2 SandboxedEnvironment 渲染。
Google 的 Gemini "Call for Me" 功能可能从商务通话扩展到亲友通话。Android Authority 在 APK 拆解中发现"Gemini Calling"引导页,示例包括"打电话给妈妈,告诉她我会晚到 15 分钟"。该功能预计仍限于类似短信的简短通话,并可能提供细粒度应用权限,让用户选择是否接收 Gemini 的自动来电。
智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。
推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。
Graphical UI 发布,一套面向编码智能体的设计语言,包含颜色、字体、间距、图标、动效等主题资源,以及基于 Base UI 的 React 组件。它通过 shadcn 安装或直接下载,并提供 GUI.md 主题参考和技能文件,让智能体将主题应用到现有界面并指导新界面开发。产品为一次性买断,含主题构建器和基础组件,可在无限项目中使用。
开发者用 Claude Code 分三次提示词、约一小时做出域名查询工具 heade.rs,并部署到 Cloudflare,可查 DNS 与注册记录、实时延迟、邮件配置和 HTTPS 详情,每月运行成本不到一杯咖啡。作者认为 LLM 让小型工具不再需要自负盈亏,受众可以只有一个人,但这类产品也更难在搜索结果中排名。
独立研究者 Syed Anas Mohiuddin 测试了 Google、摩根大通、Weaviate、Rapid7、法国政府跨部门数字局和美国联邦政府的智能体,发现 MCP(Model Context Protocol)存在信任缺口,可被利用实施提示注入。