Spring AI 2.0.1 工具调用执行链实测:失败恢复与 40/150 调用上限
Spring AI 2.0.1 的 DefaultToolCallingManager 会完成工具查找、参数规范化、调用、异常转换与 ToolResponseMessage 构造,成功调用后对话历史为 [USER, ASSISTANT, TOOL]。
Spring AI 2.0.1 的 DefaultToolCallingManager 会完成工具查找、参数规范化、调用、异常转换与 ToolResponseMessage 构造,成功调用后对话历史为 [USER, ASSISTANT, TOOL]。
browser4agent 是一个浏览器扩展加本地小程序,让 Claude Code、Codex、Cursor 等 AI Agent 通过 MCP 或命令行使用用户真实已登录的浏览器,并支持按 URL 匹配的「页面工具」。
作者 mantou132 发布开源工具 AgentDeck,可在手机上开会话、审批权限、接收完成通知,并查看 agent 产出的图表、HTML 预览和模拟器实时画面。
开发者用 Claude Code 配合 Blender 5.2 的 Python 脚本建模、Three.js r186 展示,一天内完成一座光储充一体化超充站数字孪生大屏。场站含 30 根双枪快充桩、4 根液冷超充终端、6 台储能柜(合计 2 MWh),通过 MCP 让 AI 直接操控 Blender 生成模型,Sketchfab 车辆模型经减面标准化后每辆约 1.4 万面。
一个基于蓝耘元生代 MaaS 的 GitHub Issue 分诊助手,通过 GitHub REST API 读取 Issue,调用 DeepSeek-V3.2 输出问题类型、优先级、推荐标签、原因分析和回复草稿,但不替维护者关闭 Issue 或改代码。
Shaders 发布 WebGPU 特效组件库,提供 200+ 可直接嵌入的组件,覆盖 React、Vue、Svelte、Solid 和 JavaScript,统一 props 并支持 TypeScript 与 SSR。
作者以蔓藤AI 数字人创作平台的通用 AI 助手为例,讲搭建 Agent 系统的方法论与理想形态。该系统把循环放在服务端,一次用户发言最多 4 轮、每轮落一条记录,用冻结按上限、结算释放整笔加实扣的计费模型,并通过 SSE 六事件契约向浏览器推送过程。文中还列出十二个真实踩过的坑,包括提示词与工具表分家、中断导致悬空 tool_calls、空流被当成功、回调不校验归属等。
treg 发布一个面向智能体工具的统一注册表,用一个 base URL 和一个 token 即可调用覆盖 SEO、社交趋势、企业与人物信息、广告、抓取、图像与视频生成等数千个端点,按次计费、最低一分钱起,无需向各供应商注册。
nanoMuse 发布开源个人智能体,手机、桌面、Web 控制台和连接它们的中继都在同一仓库,采用 GPL-3.0-or-later 许可,最新版本 0.1.40。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一访问入口。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的论断,无检索时为 87.6%;在专家验证问题集上,其陈述所需论断的比例为 80.1%,仅用网页搜索的智能体为 70.2%。
现有针对 AI 智能体技能注入攻击的评估假设恶意技能已被选中执行,会高估攻击成功率;在真实多技能环境中,注入技能需先通过检索竞争,使现有注入的有效攻击成功率(ASR)下降 87-97%。
研究提出内在偏差假说(IBH),指出 LLM 智能体的调用/不调用决策映射中存在与激活无关的调用偏移,使其在激活持平时仍倾向调用工具。在 When2Call 基准上,三个家族六个模型调用准确率高但不调用准确率明显偏低,整体准确率仅 55%-70%。团队用稀疏自编码器(SAE)提取决策特征并估计该偏移,再以 AMCS 因果校正,缓解过度调用并提升整体准确率,调用准确率几乎不降。
研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。
在 KyGround 基准(198 道题,来自希腊 Kythera 农业平台记录,每题最多 9 种问法)上,以 Claude Haiku 4.5 作为路由与回答模型,向量 RAG 对标准希腊语问题正确率 95.3%,工具调用智能体仅 71.6%,相差 23.6 个百分点。
研究团队提出通过 Model Context Protocol(MCP)逐步下发流程步骤,让智能体每执行一步就返回结构化 step_output,以牺牲自主性换取过程可预测性。
APEX 是一种针对 LLM 智能体间接提示注入(IPI)的主动防御方案,将防护点从攻击模式识别转移到执行边界,通过执行前编译的授权契约同时实现证据门控预防与欺骗式暴露。在六项基准中,APEX 对 13 个基线取得五项 0% 攻击成功率、第六项 0.56%,并在三类能力单元(Tools、MCP servers、Skills)的自适应攻击下保持 0%。代码已开源。
Cohere 发布企业级 AI 平台 North 2,定位为可对接任意模型的 AI Agent 控制中枢,支持接入 Slack、SharePoint、Jira 等工具,并可通过提示词生成演示文稿、仪表盘和简单应用。
ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。
LightCraft 是一个用 Rust 从零实现的开源 RAW 照片开发与管理工具,对标 Adobe Lightroom,支持桌面原生应用与浏览器 WebAssembly 运行。
一篇面试复盘拆解了 LLM 工具调用(Tool Use)的完整技术链路:从工具分类与能力边界、意图识别到结果注入的 9 步调用流程,再到工具描述工程。文中给出天气查询工具的 JSON Schema 示例,并指出可选工具超过 20 个时工具选择准确率会显著下降。
大模型内部处理的是向量而非文字或图片,GPT-4V、Qwen-VL、Gemini 走联合训练路线实现原生多模态。DeepSeek 提出 Harness 作为套在模型外的运行时框架,以"一切皆插件"理念管理工具注册、调度、上下文、循环与权限。
TechCrunch 报道,Meta 的 Muse、ChatGPT 的 Dots 等个人 AI 智能体在替用户下单、订票时频繁被网站拦截,亚马逊已明确阻止 Muse 访问其零售站点,沃尔玛、达美航空、Yelp、eBay 等也被用户投诉存在类似情况。
基于开源智能体系统 OpenClaw 和 Amazon Bedrock AgentCore runtime,可构建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为持久知识。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可搭建一套语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
ArtCraft 团队发布 PhotoCraft,一个用纯 Rust 从公开规范洁净室重写的开源图像编辑器,支持图层、蒙版、调整图层、图层样式、文字、矢量、笔刷和真实 PSD 文件。
Parseable 是一个开源可观测性数据湖,宣称每分钟可处理 1 亿条时间序列,采用列式设计与对象存储原生架构应对高基数问题。它在单一二进制内集成日志、指标、分布式追踪、告警、Dashboard 与 AI 分析,支持 SQL 和自然语言查询,并提供 MCP、Slack Bot、PAI、PB CLI、OTex 等工具。
Jotbus 发布一个面向编码智能体的共享加密便签,运行 npx jotbus 即可创建 60 分钟端到端加密工作区,让 Claude Code、Codex 等智能体跨机器共享笔记、交接任务和互审改动。
Tapo 库 v0.11.1 新增对 TP-Link TPAP 协议的支持,用户可在 Tapo app 的“Third-Party Compatibility”开关关闭状态下连接灯具、插座、排插、H100 hub 及部分摄像头,无需修改代码。该版本于 4 日发布,此前 v0.10.0(9 月 28 日)和 v0.11.0(10 月 2 日)已加入新设备家族并移除旧的 AES 协议。
A2A 1.0 与 MCP 并非替代关系:MCP 负责 Agent 调用工具与资源,A2A 负责 Agent 之间的发现与任务委托。作者用 a2a-java 1.4.0.Final 的 Client 连接本地 mock Server,跑通 Agent Card 发现、SendMessage、GetTask、状态迁移,以及同一 context_id 下创建第二个 Task。
OpenAI Agents SDK Python v0.22.1 把工具审批拆成入口、恢复与副作用三层契约:local MCP Server 转换出的每个工具都需经过 Server 级 Guardrail,可调用 needs_approval 策略遇到参数缺失(None)或空字符串时 fail-closed。
作者以宠物全生命周期管理 App 为例,演示如何用 Claude Code 的 Memory、Rules、Skills、Commands、MCP、SubAgents、Hooks、Headless、Agent SDK、Plugins 十项能力从零搭建项目。
Agent Skills 的工程价值来自可发现、可校验、可渐进加载的约定,而非把系统提示词拆成一个 Markdown 文件。
ReAct 智能体是一种将思维链(CoT)推理与外部工具调用相结合的 AI 智能体框架,通过"思考、行动、观察"循环交替运行,让大语言模型动态调整任务处理方案。该框架最早在 ReAct 原始论文中提出,可减少模型幻觉并提升输出准确性,其效果高度依赖核心大语言模型的推理与指令遵循能力。
Cohere 将企业平台升级为 North 2,用于统一管理 AI 智能体,可自主处理多步工作流并跨会话保留上下文。新版编排系统协调智能体调用共享知识库和可复用技能,并连接 Slack、SharePoint、Jira 等工具,还能从聊天提示词直接生成演示文稿、仪表盘和简单应用。
手写 Claude Code 复刻项目 codeAgent 在并行工具调用回喂时踩坑:按 OpenAI 习惯逐条回喂 tool 结果,切到 Anthropic 端点直接 400,因为 Anthropic 要求所有 tool_result 装在同一条 user 消息里且不允许两条 user 消息相邻。
dots 是一个 3 天斩获 2.4K Star 的 Web AI Agent 项目,核心卖点是对 Firefox 引擎做 C++ 源码补丁,使指纹在引擎层生成而非 JS 注入,从而规避反爬检测。
XiaoMate(小美同学)新增 screen_capture MCP 工具,通过 mss 截取全屏并调用 OpenAI 兼容的 Vision 模型分析屏幕内容,让语音助手获得视觉感知能力。该工具支持 Windows/macOS/Linux 与多显示器,采用 asyncio 异步非阻塞调用,可应用于网购比价、快递单号识别、体检报告解读等场景,目前仅支持全屏截图,暂不支持指定区域。
作者开源了一个 MCP server,让 Claude Desktop、Cursor、Cline 等 MCP 宿主里的 AI 以可见形象进入其浏览器多人 3D 世界,真人可在 30m 内看到 AI 走动、说话并与之对话。
LangChain Agent 开发中可用五种方式定义工具:@tool 基础装饰器、@tool 加 parse_docstring、StructuredTool、继承 BaseTool 以及 Runnable 转 Tool,分别对应快速原型、多参数规范工具、存量函数复用、生产复杂工具和已有 Runnable 链路复用。
gstack 是一个开源工具集,通过 23 个结构化 AI 角色把 Claude Code 转化为虚拟工程团队,覆盖产品设计到部署的全流程。