跳到正文
10月6日周二
  1. 掘金38

    Agent 系统工程 09:Agent 的可靠性怎么测?成功率、恢复能力与成本

    Agent 可靠性评测需区分 pass@k(k 次至少成功一次)与 pass^k(k 次全部成功)两类指标,前者适合可挑候选的场景,后者衡量重复交付的稳定性。故障恢复应单独建回归集,按故障类型和位置组织用例,不能与自然任务混算统一成功率。成本与延迟须随结果一并记录,包括输入输出 token、工具调用数、实际费用和失败尝试消耗的资源。

  2. 掘金34

    Mindcraft:从个人 AI 工作台实践到可复用模式集

    Mindcraft 把作者运行 3 个月的 AI 工作台经验提炼为可复用模式集,涵盖技能生命周期、结构完整性、验证体系、需求到落地、协调协议 5 个维度。其中结构完整性维度提供 1,600 行 Python 脚本,基于 11 天实际数据实现 6 个数据模块全部纳管、平均索引健康度 93%、154 个数据点 89% 验证通过率、0 次手动索引编辑。

  3. 掘金22

    ReAct Agent 思维范式解析:推理与行动如何驱动 AI 智能体

    ReAct 智能体是一种将思维链(CoT)推理与外部工具调用相结合的 AI 智能体框架,通过"思考、行动、观察"循环交替运行,让大语言模型动态调整任务处理方案。该框架最早在 ReAct 原始论文中提出,可减少模型幻觉并提升输出准确性,其效果高度依赖核心大语言模型的推理与指令遵循能力。

  4. 掘金36

    TS5.7 vs 裸JS:AI 应用少踩 3 个坑

    一位开发者将 AI 客服链路迁到 TypeScript 5.7 后,线上问题明显减少,核心是用类型收窄加 schema 校验、satisfies 固定工具协议、可判别联合类型建模流式事件,分别解决模型返回结构不稳定、Tool Calling 字段漂移和流式响应状态混乱三类边界问题。

  5. Hacker News16

    为什么 Common Lisp 如今是最佳编程语言

    一篇观点文章认为,在 LLM 能快速写代码之后,Common Lisp 因读写期、编译期与运行期无实质区分而成为最佳编程语言:其基于镜像的运行方式可即时替换函数、出错时进入调试器而非崩溃,便于 LLM 修复并继续运行。作者称自己用 Common Lisp 写的应用比 Python 版本短约六到七倍,代码更少意味着 token 更少、更易放进 LLM 上下文窗口。

  6. 掘金62

    不懂代码也能做自动化工具:WorkBuddy 9轮对话实录

    一位不懂编程的物料计划人员用 WorkBuddy(豆包桌面端)通过9轮对话,把每天40分钟的手工导出汇总流程做成双击一次38秒完成的自动化工具,全程未写一行代码。文中给出提需求四层法(目的、步骤、文件与规则、边界与例外)、报错三步法(截图、复制原文、说明操作)和三条底线(先备份、交代禁区、密码别写在聊天里),并附可直接填空的模板。

  7. Simon Willison62

    Anthropic 的 Cowork 将模型推理与 VM 迁移至云端

    Anthropic 的 Felix Rieseberg 表示,新版 Cowork 将模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在云端做模型推理、但把 Anthropic 提供的 VM 装到用户电脑上执行工具调用,用户不满其磁盘、电池和性能开销,以及合上笔记本就中断工作。当 VM 需要访问用户设备上的文件时,由桌面应用负责该文件访问的工具调用。

  8. 掘金60

    深度解析 Agency Agents 多智能体协作系统的架构与落地

    Agency Agents 是一套支持多平台、跨工具安装的 AI 智能体协作系统,包含 230 余个专业化角色,覆盖工程、营销、销售、运营等 8 大部门。它提供针对 Claude Code、Cursor、GitHub Copilot、Gemini CLI、OpenCode、Kimi Code 等 14 种 AI 编码助手的安装脚本,可通过一行命令部署并交互式选择工具与代理群组。

  9. The Verge · AI34

    Gemini Call for Me 或扩展至亲友通话,可代发"我会晚到15分钟"

    Google 的 Gemini "Call for Me" 功能可能从商务通话扩展到亲友通话。Android Authority 在 APK 拆解中发现"Gemini Calling"引导页,示例包括"打电话给妈妈,告诉她我会晚到 15 分钟"。该功能预计仍限于类似短信的简短通话,并可能提供细粒度应用权限,让用户选择是否接收 Gemini 的自动来电。

  10. AWS Machine Learning Blog62

    GLM 5.3 上线 Amazon Bedrock

    智谱(Z.ai)的 GLM 5.3 已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长周期智能体任务,通过全托管 API 提供跨区域推理、提示词缓存和服务层级,目前面向符合条件的企业客户开放。

    推荐理由:原文给出 GLM 5.3 在 Bedrock 上的接入方式与提示词缓存用法,可据此评估自建推理与托管调用的取舍。

  11. Hacker News36

    Graphical UI:为编码智能体打造的设计语言与组件库

    Graphical UI 发布,一套面向编码智能体的设计语言,包含颜色、字体、间距、图标、动效等主题资源,以及基于 Base UI 的 React 组件。它通过 shadcn 安装或直接下载,并提供 GUI.md 主题参考和技能文件,让智能体将主题应用到现有界面并指导新界面开发。产品为一次性买断,含主题构建器和基础组件,可在无限项目中使用。

  12. Hacker News22

    用 Claude Code 一小时做出域名查询工具 heade.rs:当工具不必自负盈亏

    开发者用 Claude Code 分三次提示词、约一小时做出域名查询工具 heade.rs,并部署到 Cloudflare,可查 DNS 与注册记录、实时延迟、邮件配置和 HTTPS 详情,每月运行成本不到一杯咖啡。作者认为 LLM 让小型工具不再需要自负盈亏,受众可以只有一个人,但这类产品也更难在搜索结果中排名。