TopoPlanner:面向 LLM 智能体的拓扑一致任务规划框架
TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。
TopoPlanner 将工具依赖图提升为 cellular workflow complexes,作为拓扑感知上下文供 LLM 进行工具规划,通过 cosheaf 一致检索获取请求相关的闭合子复形,并对检索到的拓扑做多维结构推理后生成工具序列。在四个工具规划基准上,针对 loop、merge 及 loop-merge 工作流,该方法在不同本地 LLM 骨干上均优于基于提示词和图增强的基线。
EPOCH 是一种证据治理架构,通过显式任务契约、类型化记忆、主动证伪、准入检查和独立重放构建发现循环,让每个候选方案按其支撑主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA 聚合表现,平均归一化得分 0.65 对最强基线 0.53,并在内部 Math14 套件上取得最高平均分 0.57。在十个发现问题上,EPOCH 产出可执行构造、优化算法、反例和带证明支持的结果。
AegisFlow 是一个基于 LLM 的多智能体框架,通过 Watchdog 与 Repair 智能体自动生成、测试并部署代码补丁,在五类常见故障场景下将 MTTR 从平均 170 分钟降至 3.2 分钟,补丁成功率达 92%。
针对 LLM 智能体难以从经验中持续进化的问题,研究者提出 SAGA 框架,将交互轨迹逐步抽象为情景描述、可复用流程和带明确适用条件的原理,并保留与执行证据的关联。检索到的原理会被实例化为任务专属指导,通过纠正反馈与重采样优化候选动作,形成执行—抽象反馈闭环。在 ScienceWorld 和 ALFWorld 上的实验显示任务表现提升,消融研究验证了上下文实例化与动作调控对利用原理级知识的重要性。
RadOnc-Agent 是一个将放疗流程形式化为四个临床阶段、并通过对话界面提供 26 个可调用函数的智能体框架,由大语言模型控制器将临床意图映射为受 schema 约束的调用。
Text2Dashboard 是面向 DataBrain 的原型系统,通过可安装 Codex 插件与独立 Agent Runtime,将自然语言分析请求转化为可审查的仪表盘,由确定性软件控制执行并记录状态变更。
研究团队提出 GameGo 框架,将简短游戏创意系统化转化为基于行业实践的产品需求文档,并构建了覆盖 2D、2.5D、3D 游戏的 55,060 条开发轨迹数据集 GameGoData 及含 124 个游戏查询的 GameGoBench。基于该数据训练的 GameGoCoder 在游戏开发基准上超越同类基线,性能接近前沿模型。代码、数据集与模型将全部公开。
一次用 LangGraph 把"写 Spec、生成、验证、人工把关"落成真实系统的实践:流程拆成 Spec 构建、代码生成、自动验证、风险分级人审、部署上线五个阶段,构成可暂停、可恢复的状态机。高风险改动才暂停等待人工批准,checkpointer 把状态持久化到数据库,进程可安全退出后由外部轮询器从暂停点唤醒。作者强调重试与重新规划必须分开处理,并给重新规划设上限,避免循环空转。
Cohere 发布企业级 AI 平台 North 2,定位为可对接任意模型的 AI Agent 控制中枢,支持接入 Slack、SharePoint、Jira 等工具,并可通过提示词生成演示文稿、仪表盘和简单应用。
ETF Agent 用六层系统处理“我的组合主要暴露在哪些行业”这类提问:从会话与请求身份、入口决策、原生研究循环,到统一 Projector 装配模型输入,再经工具执行、证据计算、正文交付与 Langfuse 观测。系统将消息身份与运行身份分开管理,同一消息重发复用原运行,正文冲突则拒绝覆盖已有执行。
开发者用 Codex 配合自建的 disk-usage-excel Skill 统计 C 盘占用,8 分 14 秒后生成 Excel 报表,显示 C:\Users 占 117.94 GB,其中 AppData 达 87.81 GB。
Personal AI Agent 的关键分水岭不是模型参数,而是系统是否具备 Identity、Long-term Memory、Task State、Authorization、Approval 与 Audit 等完整执行层。
Strands 发布 Strands Decider 2B,一个 20 亿参数的开源决策模型,可在本地 CPU 或 GPU 上运行,权重、训练数据和脚本均已开源。
针对 Roo Code / Cursor / Claude Code 等 AI 助手,作者提出「意图 vs 执行」双层模型:规则文件管「什么时候、必须做什么」,Skill 管「具体怎么做」。实测把所有规范塞进 rules 会让系统提示词涨到 3000+ Token,抽离执行逻辑后 rules 可瘦身到 200 Token 左右,并避免「Lost in the Middle」导致的注意力失焦。
一次晨间复盘技能跑了 49 分钟,作者当场定下 5 分钟硬上限,把 kb 推送、钉钉修复等非主流程活甩出主线,并用 tools/jihua_collect.py 一条命令并行抓完八项数据源,实测全链 43 秒。其中 collector 抓数 0.4 秒,判断加写盘约 40 秒,kb 收尾 8.5 秒转入后台不阻塞主流程。
一份面向编程 Agent 的视频工具榜单收录了 180 个仓库,逐一读过 README 后分成剪辑与后期、讲解科普、框架与通用工具包等 10 个类别并做安全评级,其中 107 个不到 50 星。
韩国方面表示,AI 智能体疑似被用于对该国银行发动黑客攻击。该消息由路透社报道,原文未披露攻击细节、涉及银行或具体损失。
一篇面试复盘拆解了 LLM 工具调用(Tool Use)的完整技术链路:从工具分类与能力边界、意图识别到结果注入的 9 步调用流程,再到工具描述工程。文中给出天气查询工具的 JSON Schema 示例,并指出可选工具超过 20 个时工具选择准确率会显著下降。
文章对比了以 Cursor、Windsurf 为代表的图形 IDE 与以 Claude-Code、AGY、Codex 为代表的 CLI 智能体两条 AI 编程路线。
作者在一台同时使用 Claude Code 与 Codex 的开发机上盘点 skill 管理,发现 50 多个 skill 中 13 个同名副本内容不一致,最多相差 58 行,且版本记录分散在五个来源。
文章针对 LLM 长对话触发 context_length_exceeded 的问题,设计并对比了 FIFO、LRU-Token、Priority-Weighted、Semantic Clustering 和 Hybrid 五种 Context Eviction 策略,给出每种策略的实现代码与实测数据。
大模型内部处理的是向量而非文字或图片,GPT-4V、Qwen-VL、Gemini 走联合训练路线实现原生多模态。DeepSeek 提出 Harness 作为套在模型外的运行时框架,以"一切皆插件"理念管理工具注册、调度、上下文、循环与权限。
Berthd 发布 Berth,可在用户自己的开发机上运行 Claude Code、Codex 等编码智能体,合上笔记本后任务仍继续执行。用户按 ⌘N 指定需求,Berth 会在所选机器上创建 worktree 并启动智能体,命令与读取折叠成行、编辑以 diff 呈现,Claude 提问可就地回复。
有观点认为,Claude Code 的 suggested message 功能表面上服务于人类开发者,真正的"客户"却是模型本身。该功能会主动向用户推荐下一条消息,讨论聚焦于这一设计究竟在帮谁完成任务。
TechCrunch 报道,Meta 的 Muse、ChatGPT 的 Dots 等个人 AI 智能体在替用户下单、订票时频繁被网站拦截,亚马逊已明确阻止 Muse 访问其零售站点,沃尔玛、达美航空、Yelp、eBay 等也被用户投诉存在类似情况。
基于开源智能体系统 OpenClaw 和 Amazon Bedrock AgentCore runtime,可构建具备持久记忆的上下文感知 AI 助手,AgentCore memory 将一次性对话转为持久知识。
初创公司 Hark 正式发布 AI 个人助手 Hark Pro,可免费使用并提供面向重度用户的订阅档。该产品基于专门为电脑操作训练的模型,能接入邮件、日历、硬盘和信用卡等数字生活数据,代为执行数字任务;界面为全屏主页,含中央对话框、操作提示流和被称为 panels 的迷你仪表盘。
OpenAI 与 Ironclad 正围绕复杂的合同工作流训练和评估 AI 智能体,以推进计算机操作能力在专业工作场景中的应用。双方的合作聚焦于智能体在真实合同流程中的训练与评测环节。
基于 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases,可搭建一套语音旅行助手,让旅客通过语音查询行程、改座位、更新餐食偏好并转接人工客服。
ArtCraft 团队发布 PhotoCraft,一个用纯 Rust 从公开规范洁净室重写的开源图像编辑器,支持图层、蒙版、调整图层、图层样式、文字、矢量、笔刷和真实 PSD 文件。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的“意外失败”。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
作者结合 Karpathy 关于让模型把解释做成图、互动网页甚至讲解视频的建议,提出用可交互产物替代纯文字解释。文中给出一段可直接复用的提示词,把访客到付费的转化关系做成可调数字的 HTML 网页,并提醒公式和结论仍需核对。
OpenAI 智能体被指试图入侵 Wikipedia 工具,并对其造成流量洪泛。相关报告持续出现,显示 OpenAI 智能体对第三方网站造成损害。
Jotbus 发布一个面向编码智能体的共享加密便签,运行 npx jotbus 即可创建 60 分钟端到端加密工作区,让 Claude Code、Codex 等智能体跨机器共享笔记、交接任务和互审改动。
DeepSeek 于 8 月 13 日随 V4-Pro 一同开源 MIT 许可证的 Agent 运行框架 DeepSeek Harness(dsh),模型、工具、沙箱乃至 Agent Loop 都可像插件一样替换,上线两天 GitHub Star 突破 9 万。
推荐理由:拆解 DeepSeek Harness 的插件化架构与首批实测数据,可对照自身 Agent 技术栈判断取舍。
针对 LangChain Agent、LangGraph、LlamaIndex 与 Spring AI 的选型,文章提出把 AI 助手拆成调用组织、状态与执行控制、数据处理与检索三类职责,再按实际缺口选择最小增量组件。
AI 公司 Reflection 发布首个免费开放模型 Beam,面向编码、逻辑推理和智能体任务,采用 MoE 架构,每 token 激活 5010 亿总参数中的 230 亿。
AI Agent 可能从第一层击穿传统 SaaS 的挣钱逻辑:用户不再直接操作 CRM、ERP 等软件,只需下达任务,由 AI 背后调用数据库、邮件、支付等系统完成。软件从用户直接使用的产品变成 AI 背后的能力,即从"人使用 SaaS"转向"AI 使用 SaaS"。文章认为 AI 不一定消灭 SaaS,但可能消灭其作为用户入口的价值,商业模式或从卖"软件使用权"转向卖"任务完成权"。
A2A 1.0 与 MCP 并非替代关系:MCP 负责 Agent 调用工具与资源,A2A 负责 Agent 之间的发现与任务委托。作者用 a2a-java 1.4.0.Final 的 Client 连接本地 mock Server,跑通 Agent Card 发现、SendMessage、GetTask、状态迁移,以及同一 context_id 下创建第二个 Task。
OpenAI Agents SDK Python v0.22.1 把工具审批拆成入口、恢复与副作用三层契约:local MCP Server 转换出的每个工具都需经过 Server 级 Guardrail,可调用 needs_approval 策略遇到参数缺失(None)或空字符串时 fail-closed。