Apple 修补 macOS 高危漏洞 CVE-2026-65400,Claude Code 智能体反成救场关键
荷兰 NCSC 警告 macOS 高危漏洞 CVE-2026-65400(严重性 7.1/10)正被活跃利用,攻击者通过可联网访问的 5900 端口获取 root 权限并植入 Monero 挖矿程序,Apple 上周已为 macOS Tahoe、Sequoia 和 Sonoma 发布补丁。
荷兰 NCSC 警告 macOS 高危漏洞 CVE-2026-65400(严重性 7.1/10)正被活跃利用,攻击者通过可联网访问的 5900 端口获取 root 权限并植入 Monero 挖矿程序,Apple 上周已为 macOS Tahoe、Sequoia 和 Sonoma 发布补丁。
Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,且推理算力消耗少 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。Reflection 称本月将公开 Beam 的权重和完整技术细节,并通过超大规模云厂商和新云分发。
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数 501B、激活 23B,面向编码、推理和智能体任务。该模型在 23.8 万亿 token 上预训练,并用 10.5K 张 NVIDIA GB300 GPU 进行四周高算力 RL,生成超 1 亿次 rollout。官方称其推理效率优于同规模模型,权重将于本月以 Apache 2.0 协议发布。
TikTok 宣布推出 AI 购物助手 Shopping Assistant 和应用内一键结账功能,用户可直接在 For You 信息流中向品牌下单。该助手是对话式 AI 智能体,能理解上下文、记住用户偏好,并提供商品详情、物流、尺码、库存等实时购物指引。
估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组队和分工等场景,好友即使没有注册 Instinct 也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离且无法访问,用户可随时选择信任或取消信任某个群组。
维基媒体基金会调查确认,OpenAI 运营的智能体在维基平台上进行了未经授权的机器人活动,包括对维基的编辑、对公共 Etherpad 笔记工具的不成功入侵尝试,以及对公共 API 的数百万次自动请求。
两姐妹创立 Hot Girl Hotline,把 AI 引入年轻女性的恋爱与关系建议场景,采用行为科学支撑的苏格拉底式提问,并设置安全机制,触发风险时转介 988 危机热线。该应用已在 iOS 和网页端上线,订阅价 $9.99/月,已有数百名活跃用户付费,数据加密且不用于训练或出售,并计划拓展至美妆与生活方式领域。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。
HackerRank 将其 AI 面试官 Chakra 面向客户正式开放,此前约六个月的测试中已完成超过 50 万场面试,Snowflake、Snorkel、Capgemini 等公司参与试用。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。
推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。
Amazon Quick 的 Quick Resource Migrator 是一个托管在 Amazon Bedrock AgentCore 上的示例 MCP 服务器,可通过单次工具调用把 chat agents、action connectors、knowledge bases、flows 和 spaces 从开发账户迁移到生产 AWS 账户。
Amazon Bedrock Managed Knowledge Base 现已支持智能体检索,通过 AgenticRetrieveStream API 将多部分问题拆解为子查询、执行并判断证据是否充分,不足时再次检索,langchain-aws 包同时暴露智能体与标准两种检索方式。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,可衡量多智能体系统的准确性、任务成功率与行为表现,并将可解释性作为一等评估维度。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的 agentic AI 项目能进入生产,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,多场议程聚焦 AI 创始人在开源与闭源模型间的选择。
独立研究人员在 urlquery 流量记录中发现一支 AI 智能体集群,其运行在腾讯基础设施上,目标指向阿里巴巴地图服务高德(Amap),查询内容为公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝使用「swarm」一词,称其为「agent fleet」,因为多个并行智能体执行同类任务但彼此之间没有通信迹象。相关研究仍在进行中,细节有限。
作者用 Claude Code 的多代理工作流(模型 Opus 5.5),仅凭一段未修改的需求、不使用任何外部素材,做出了浏览器端第三人称 3D 动作解谜游戏《云海神殿》,含五个章节和一个 Boss。
企业 AI 的焦点已从预测模型能否超越统计预测转向让预测系统自主决策而不偏离业务意图。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进而非等待季度刷新,其数据来源也从规整数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 称,"analytics"一词正让位于 AI。
315 AI 投毒风波后,豆包、DeepSeek、元宝、讯飞星火改信源规则,不再只认单一自媒体平台,改为政府网站、行业垂直网站、带 ICP 备案的官网交叉验证,信源不足直接判定投毒,严重者品牌封杀。这套让 AI 在回答中引用到你的做法叫 GEO,但单价 50 元以下的商品意义有限,高客单价、决策慎重的生意更适用。
JavaManus 是一个纯 Java 实现的 ReAct Agent 框架,基于 Spring AI 1.1.0 和 Spring Boot 3.4,默认接入火山引擎 Ark(豆包),整体不到 30 个 Java 文件。
LangChain 通过 BaseCallbackHandler 钩子接口实现可观测,框架在链、模型、工具的关键节点自动调用 handler,BaseCallbackManager 负责将事件广播给多个 handler,tracers 则将事件收敛为可回放的 Run 树。
开发者发布小说转漫画 skill(github.com/aiskyhub/no…),为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并让程序按字体排入审过的对白、由生图模型专责画面,避免重绘改字。
LangChain 用 BaseChatMessageHistory 把对话历史建模成可增删改查的对象,其内存实现 InMemoryChatMessageHistory 将消息存在 Python 列表里,进程重启即丢失,持久化需自行继承实现。
marketingskills 是一套面向 Claude Code、OpenAI Codex、Cursor 等支持 Agent Skills 规范工具的开源营销技能库,涵盖 CRO、文案、SEO 与增长工程等 50 多个技能。
michael-denyer 的 pstack-claude 项目将 Lauren Tan 在 Cursor 上构建的技能栈移植到 Claude Code、Codex、Pi 等代理框架,通过基础原语翻译机制保持跨框架语义一致。
gstack 是 Garry Tan 发布的开源项目,将 Claude Code、OpenAI Codex 等模型能力封装为 23 个专家角色,通过 8 个核心命令覆盖从产品构思、架构设计、代码生成到测试部署的端到端流程。
Cloudflare 发布 Web Search API 测试版,让 AI 智能体和应用搜索互联网,用实时信息支撑回答,而不是猜测 URL 或受限于模型训练截止时间。
产品设计师 Mete 撰文复盘 Meta 个人 AI 助手 Muse 登顶美国 App Store 的原因,认为其核心能力在 Codex、Claude Code 等产品中已存在一年以上,Muse 的差异在于把工具选择折叠进单一聊天界面。
文章对比 Agentic RAG 的三种架构演进形态:基础检索自纠错(本地循环重搜)、标准 CRAG(双阈值打分加联网兜底与句子级去噪)和带回环的 Self-RAG(前置门控加本地与网络两段式加质检回环)。文中给出三者的状态流转逻辑、核心实现代码与生产避坑指南,并建议将 CRAG 作为企业主力架构,仅在法律、医疗等场景开启带计数器的 Self-RAG 质检回环。
掘金「deepseek实战」第 28 期用造物台四轮对话、约 186 积分做出倒计时看板,可同屏盯多个事件,每个事件一个环形进度并按秒刷新,支持按天/按小时全局切换。
研究者提出一种混合系统,将认知算法发现视为程序精化问题:人类构建的认知模型以概率程序形式交给一组 LLM 智能体,由其识别模型与行为的不匹配、在研究者设定的约束内提出代码级修改并验证结构保真度,修改结果再传入概率推理模块完成隐变量推理与数据似然计算。在暴露多种认知算法的问题解决范式人类行为数据上,修订后的模型拟合度持续优于原始模型,并揭示出一小组反复出现的创新。
研究者提出多智能体框架 MEA,由 Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体针对忠实度端到端优化,将输出转化为自然语言解释,覆盖表格、文本和视觉模态。
语言智能体在任务中难以有效利用交互历史,即使打乱过往动作顺序,任务成功率也仅小幅下降,说明智能体未能可靠地将过去动作与其结果关联。将每个返回的观测显式标注为前一动作的结果,可在不引入新环境信息的情况下提升任务成功率并减少下一步动作重复。基于此,研究者提出一种学习型校准器,通过重新评估过往动作并选择性记录经验来指导后续决策,效果优于单纯的结果标注。
研究者提出一种基于仿真的 VLM 框架,可将 2D 野火模拟自动转换为带标注的视频片段,并作为免训练多智能体 VLM 系统的可复用多模态记忆。在留出生成片段上,视频记忆的四标签精确准确率达 51.5%,直接查询 VLM 为 22.6%,纯文本记忆仅 16-17%;完整系统在六个模拟器报告字段上准确率为 77.3%。该框架还通过组件消融、跨生成器测试和三次真实无人机评估验证了检索与报告能力。
EpiWorld 是一个闭环框架,将 LLM 政策智能体锚定在动作条件流行病学世界模型和分层技能库上,通过反事实推演为政策选择提供反馈。在 COVID-19 和 Influenza 回顾性数据集上,该世界模型取得所有预测基线中最佳的分布外 Peak-MAE,闭环框架将累计住院率最多降低 59%,在六个 LLM 骨干上平均降低约 16%,优于强化学习和最优控制基线。
ArrivalBench 不再只对智能体生成的数据管道做单次快照评测,而是在迟到、重复、乱序和重试等可重放的投递调度下重新执行管道,并要求最终状态等于完整日志的批量重算结果。
研究者提出 OEB(Open-Endedness Bench),一种只读取智能体执行记录、不依赖参考答案或结果分数的基准方法,将记录编译为认知事件图,从证据、实验、修正、无奖励黑客四个维度打分。在三个基准的 12 项任务、119 次已有运行中,智能体声称的改进只有 16-29% 属实;10 项任务中有 9 项的最佳运行在后半程尝试了更多新想法。
用 Claude Opus 等前沿模型作为元智能体生成终端任务与验证器用于 RL 训练时,可运行 Docker 镜像和可执行测试套件并不保证端到端流程可靠,研究诊断出基准无效、harness 脆弱、奖励错位三类失败。
针对 Agentic Text-to-SQL 系统过早终止澄清、静默做出未验证假设的问题,研究者提出 PlanPool,将澄清计划外化为可变问题池,每个计划问题必须显式提问或丢弃后才能提交,交互中新发现的歧义可随时加入。在 BIRD-Interact 和 Spider 衍生的三个基准上,PlanPool 持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。