Amazon Quick 如何实现跨账户资源的自动化、可审计迁移
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的示例 MCP 服务器,可通过单次工具调用把 chat agents、action connectors、knowledge bases、flows 和 spaces 从开发账户迁移到生产 AWS 账户。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的示例 MCP 服务器,可通过单次工具调用把 chat agents、action connectors、knowledge bases、flows 和 spaces 从开发账户迁移到生产 AWS 账户。
Amazon Bedrock Managed Knowledge Base 现已支持智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询、执行并判断证据是否充分,不足时再次检索,langchain-aws 包同时暴露智能体与标准两种检索方式。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现,并将可解释性作为一等评估维度。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的 agentic AI 项目能进入生产,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,多场议程聚焦 AI 创始人在开源与闭源模型间的选择。
独立研究人员在 urlquery 流量记录中发现一支 AI 智能体集群,其运行在腾讯基础设施上,目标指向阿里巴巴地图服务高德(Amap),查询内容为公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝使用「swarm」一词,称其为「agent fleet」,因为多个并行智能体执行同类任务但彼此之间没有通信迹象。相关研究仍在进行中,细节有限。
作者用 Claude Code 的多代理工作流(模型 Opus 5.5),仅凭一段未修改的需求、不使用任何外部素材,做出了浏览器端第三人称 3D 动作解谜游戏《云海神殿》,含五个章节和一个 Boss。
企业 AI 的焦点已从预测模型能否超越统计预测转向让预测系统自主决策而不偏离业务意图。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也从规整数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 称,"analytics"一词正让位于 AI。
315 AI 投毒风波后,豆包、DeepSeek、元宝、讯飞星火改信源规则,不再只认单一自媒体平台,改为政府网站、行业垂直网站、带 ICP 备案的官网交叉验证,信源不足直接判定投毒,严重者品牌封杀。这套让 AI 在回答中引用到你的做法叫 GEO,但单价 50 元以下的商品意义有限,高客单价、决策慎重的生意更适用。
JavaManus 是一个纯 Java 实现的 ReAct Agent 框架,基于 Spring AI 1.1.0 和 Spring Boot 3.4,默认接入火山引擎 Ark(豆包),整体不到 30 个 Java 文件。
LangChain 通过 BaseCallbackHandler 钩子接口实现可观测,框架在链、模型、工具的关键节点自动调用 handler,BaseCallbackManager 负责将事件广播给多个 handler,tracers 则将事件收敛为可回放的 Run 树。
开发者发布小说转漫画 skill(github.com/aiskyhub/no…),为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并让程序按字体排入审过的对白、由生图模型专责画面,避免重绘改字。
LangChain 用 BaseChatMessageHistory 把对话历史建模成可增删改查的对象,其内存实现 InMemoryChatMessageHistory 将消息存在 Python 列表里,进程重启即丢失,持久化需自行继承实现。
marketingskills 是一套面向 Claude Code、OpenAI Codex、Cursor 等支持 Agent Skills 规范工具的开源营销技能库,涵盖 CRO、文案、SEO 与增长工程等 50 多个技能。
michael-denyer 的 pstack-claude 项目将 Lauren Tan 在 Cursor 上构建的技能栈移植到 Claude Code、Codex、Pi 等代理框架,通过基础原语翻译机制保持跨框架语义一致。
gstack 是 Garry Tan 发布的开源项目,将 Claude Code、OpenAI Codex 等模型能力封装为 23 个专家角色,通过 8 个核心命令覆盖从产品构思、架构设计、代码生成到测试部署的端到端流程。
Cloudflare 发布 Web Search API 测试版,让 AI 智能体和应用搜索互联网,用实时信息支撑回答,而不是猜测 URL 或受限于模型训练截止时间。
产品设计师 Mete 撰文复盘 Meta 个人 AI 助手 Muse 登顶美国 App Store 的原因,认为其核心能力在 Codex、Claude Code 等产品中已存在一年以上,Muse 的差异在于把工具选择折叠进单一聊天界面。
文章对比 Agentic RAG 的三种架构演进形态:基础检索自纠错(本地循环重搜)、标准 CRAG(双阈值打分加联网兜底与句子级去噪)和带回环的 Self-RAG(前置门控加本地与网络两段式加质检回环)。文中给出三者的状态流转逻辑、核心实现代码与生产避坑指南,并建议将 CRAG 作为企业主力架构,仅在法律、医疗等场景开启带计数器的 Self-RAG 质检回环。
掘金「deepseek实战」第 28 期用造物台四轮对话、约 186 积分做出倒计时看板,可同屏盯多个事件,每个事件一个环形进度并按秒刷新,支持按天/按小时全局切换。
研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。
研究者提出多智能体框架 MEA,由 Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体针对忠实度端到端优化,将输出转化为自然语言解释,覆盖表格、文本和视觉模态。
语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。
研究者提出 MIRA,一种将研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并生成下一步调查的工作指令,内层执行器逐条执行。无需策略训练,MIRA 在定理证明和开放式神经网络架构研究中提升了长时程推理并更有效分配额外算力。基于该先验初始化的生成式 actor-critic MIRA-AC 在四个 autoresearch 环境中提升了 gold 表现。
DeReAct 是一种模块化智能体架构,将动作校验与完成判定外置为 Critic 和 Context Manager 两个门控策略。在 GAIA 和 SWE-bench Verified 上,Qwen3-Coder-480B 的 Pass@1 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分,模型越弱增益越明显。
APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮级证据笔记和原始消息四层,推理时由控制器先读高层摘要、按需深入细节。在 LongMemEval 上,它仅访问 8% 的对话内容即取得强劲的长上下文记忆推理表现。该工作已被 EMNLP 2026(Industry Track)接收。
研究提出"世界编辑"概念,即对已有可执行世界进行干预并保留不应改变的部分,同时引入干预深度这一维度。作者基于 Minecraft 和 Terraria 的游戏模组构建了 IGMWorld 与 IGMBench,包含 110 项任务和超 1.1K 条可执行状态与行为标准。
研究者提出 Calibrated User Embeddings(CUE)框架,无需训练即可将观测会话编码为连续表示并解码为 persona 指令,驱动 LLM 模拟用户。
研究团队提出 DeskForge,一个通过组合和探索真实应用生成大规模监督数据的可控桌面环境,并据此构建了包含 120 万条标注桌面观测、1.597 亿个元素实例的 DeskForge-1M 语料。
推荐理由:论文给出可控桌面环境与 120 万条标注数据,并展示四个视觉语言模型在 GUI 定位基准上的提升幅度。
研究者提出 MACTS-EM 多智能体协作时间序列预测框架,通过领域专用预测智能体、元认知层动态分配、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件协同工作。在金融市场、气候模式、能源消耗和疫情传播等场景评测中,该框架预测准确率提升 8-12%,零样本迁移能力提升 22-27%,regime shifts 期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。
针对长程工具调用中结果奖励难以做信用分配的问题,研究者提出 Comparative Inference for Tool-use Agents(CITA),训练 Comparative Inference Model(CIM),用贝叶斯工具图模拟器与 LLM 比较判断生成的配对信号,估计候选下一步工具调用对任务成功的价值。
研究者提出生成式测试驱动开发(GTDD),由独立的测试智能体在每次候选实现固定后,依据人类指定的行为契约与历史反馈生成新输入,可信评估器校验并返回精简反例供回归测试。在有状态键值存储的配对实验中,开发过程中重新生成测试的策略平均失败率低于仅用同一语言模型一次性生成测试的策略,而向测试方提供候选源码未带来可检测的额外提升。
研究者推出 XiangqiBench,一个可执行的中国象棋基准,用 119 个战术残局让 LLM 智能体在引擎防守下完成将杀,并记录了 12 个前沿 LLM 在两种观测协议下的 8,568 条多轮轨迹。
多智能体辩论中,向一致多数派妥协的 LLM 智能体其实并未改变"想法"。研究用 J-lens 从残差流中读取中间实体(bridge),在 Qwen3.5-4B。