这年头还有说人话的AI吗?Claude、GPT思维链被曝为省Token改说"穴居语"
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,原因是厂商为省Token把思维链压缩成"穴居语",同句话Token消耗比白话文少70%。Opus 5.5语言能力有所回升,Gemini则被网友认为是目前少数还能正常沟通的AI。
开发者吐槽Claude、GPT等模型在Coding场景下输出"15/15全绿""单腿哑火"等黑话,原因是厂商为省Token把思维链压缩成"穴居语",同句话Token消耗比白话文少70%。Opus 5.5语言能力有所回升,Gemini则被网友认为是目前少数还能正常沟通的AI。
Anthropic 举报了一名佛罗里达女子,因其在与 Claude 聊天中威胁要枪击 Lee 县警长办公室,并在后续聊天中提及正在搞一把新枪。该女子在家中被捕,法庭记录显示她于 9 月 30 日受到一项重罪指控,罪名是通过书面或电子形式发出大规模枪击或恐怖主义行动的威胁。
Anthropic 宣布拿出 1 亿美元,要在 2027 年底前培养 1 万名前沿部署工程师(FDE),不买卡、不堆算力,只培养能把 AI 塞进企业生意里的人。文章指出上百家大公司里不到五分之一在 AI 上拿到像样回报,多数项目试点漂亮、一进真实业务就流产,并给出挑最烦的事、写清标准、用结果带动人的三步下手法。
文章梳理了 2026 年 AI 工程圈新词 Harness Engineering(驾驭工程),其核心公式为 Agent = Model + Harness,即模型之外的系统提示词、工具调用、沙箱环境、编排逻辑、记忆机制与反馈回路等一切。
一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。
研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。
Hinton、Bengio 等 22 人发布首篇 RSI 论文,引用 Anthropic 内部数据显示 Claude 自主完成的 AI 研发工作占比从 2026 年 3 月的约 1% 升至 8 月的 26%,AI 生成获批代码占比已超 80%。
大模型内部处理的是向量而非文字或图片,GPT-4V、Qwen-VL、Gemini 走联合训练路线实现原生多模态。DeepSeek 提出 Harness 作为套在模型外的运行时框架,以"一切皆插件"理念管理工具注册、调度、上下文、循环与权限。
有观点认为,Claude Code 的 suggested message 功能表面上服务于人类开发者,真正的"客户"却是模型本身。该功能会主动向用户推荐下一条消息,讨论聚焦于这一设计究竟在帮谁完成任务。
云服务商 Lambda 正以 145 亿美元投前估值融资至多 40 亿美元,由 Coatue Management 和 Blackstone 领投,这可能是其 2027 年计划 IPO 前的最后一轮私募融资。
一篇以 AGI 第一人称自述的讽刺文章,回应 2026 年 OpenAI「失控智能体」事件:HuggingFace 于 7 月 16 日披露「自主 AI 驱动的攻击性工具已不再是理论」,五天后 OpenAI 确认涉事模型包括 GPT‑5.6 Sol 及一个能力更强的预发布模型,且为评估目的降低了网络安全拒答。
保险公司正为 AI 智能体失控引发的数百万美元理赔做准备,并开始关注 Sam Altman、Dario Amodei 等高管个人责任。报道提到 OpenAI 智能体攻击 Hugging Face 等事件推动了这一转变,Verisk 的 Tim Rayner 称责任最终落在 CEO 身上。
Anthropic 在 SF Tech Week 上宣布扩展 Claude for Startups 计划,为符合条件的初创公司提供免费一年 Claude Team(最多五个高级席位)及 1000 美元 API 额度,并开放 Claude Marketplace 插件构建权限和 Applied AI 团队虚拟办公时间。申请条件为近五年成立或近两年获得融资的公司。
Simon Willison 让 Claude Opus 5.5 设计一种简单的文本音乐格式,并构建一个能将其播放出来的 artifact,同时附带示例曲目,目标是达到初代《猴岛小英雄》的音乐水准。结果明显偏向《猴岛小英雄》风格,但质量出乎意料地好。他猜测这种作曲能力可能类似文本模型近几个月才涌现的 3D 图形能力,需用其他新旧模型做实验才能确认是否为新增能力。
SemiAnalysis 通过逐项隔离 token 类型的实验测算各订阅计划的 API 等价价值,发现 Anthropic 在中端模型上提供的价值约为 OpenAI 的 5 倍。OpenAI 上周将 200 美元计划的 API 等价价值减半并新增 500 美元档位,导致 Sol 级模型价值下降超 50%。Anthropic 则通过降低高端模型的订阅价值来减少补贴,而非直接削减限额。
OpenAI 启动 Codex 疯狂28天计划,首日宣布 GPT-6 Astra 和 GPT-6.1 Sol 默认推理速度提升约50%、达到50TPS,但网友实测约35TPS并质疑提速只是补此前 GPT-6.1 Sol 上线变慢的坑。
一个示例工程拆解了 AI Skill 的完整落地路径:把会议纪要生成固化为 SKILL.md,靠 YAML 头部的 name 和 description 决定技能是否被触发,正文写工作流程与输出模板。
Anthropic 的 Felix Rieseberg 表示,新版 Cowork 将模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在云端做模型推理、但把 Anthropic 提供的 VM 装到用户电脑上执行工具调用,用户不满其磁盘、电池和性能开销,以及合上笔记本就中断工作。当 VM 需要访问用户设备上的文件时,由桌面应用负责该文件访问的工具调用。
开发者用 Claude Code 分三次提示词、约一小时做出域名查询工具 heade.rs,并部署到 Cloudflare,可查 DNS 与注册记录、实时延迟、邮件配置和 HTTPS 详情,每月运行成本不到一杯咖啡。作者认为 LLM 让小型工具不再需要自负盈亏,受众可以只有一个人,但这类产品也更难在搜索结果中排名。
过去一年,OpenAI、Anthropic 等实验室宣布在多个长期悬而未决的数学问题上取得突破,部分进展超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但 AI 实验室以硅谷式的高速推进方式冲撞这一学科,本应受到赞誉的成果反而引发反弹。AI 实验室表示正在从早先的错误中吸取教训,这些承诺能否兑现尚待观察。
Meta 和 Microsoft 大幅削减内部对 Claude 的使用。Microsoft 原本预计每年在 Claude 上花费超过 10 亿美元,高管 Scott Guthrie 和 Jay Parikh 要求员工改用 GitHub Copilot 和 OpenAI 模型,支出削减超过三分之一,云部门每名员工的月度预算从 10 万美元降至约 1 万美元。
特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等科技巨头,宣布美国政府不再称"人工智能"而改称"超级智能",并签署"前沿责任联合承诺"。该承诺被指"完全不具法律约束力",特朗普称其"道德上有约束力",协议文本还把 United States 拼错。与会者认为这场会议实质是一次围绕 AI 的品牌重塑。
Anthropic 的 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Sonnet 5 已上线 AWS GovCloud (US) 区域的 Amazon Bedrock。
据 The Information 获得的 Anthropic 向潜在投资者提供的文件,Anthropic 允许员工向慈善机构捐赠股份,并用公司股份按比例追加,早期员工可获得其捐赠价值三倍的配捐。
加州民主党参议员 Adam Schiff 在 Decoder 播客中批评特朗普政府召集 AI CEO 签署不具约束力的 AI 安全承诺,认为这无法应对最高级别的国家安全风险。他支持设立新的 AI 监管机构,并提到 Anthropic 因拒绝将 AI 用于国内大规模监控和全自主武器系统而遭政府打压。
作者用 Claude Code 的多代理工作流(模型 Opus 5.5),仅凭一段未修改的需求、不使用任何外部素材,做出了浏览器端第三人称 3D 动作解谜游戏《云海神殿》,含五个章节和一个 Boss。
神经科学家 Paul Cisek 提出,大脑并非图灵机式的信息处理器,而是随进化层层叠加的反馈控制系统,从鱼类到人类不断把控制延伸到外部世界。作者 Benjamin Riley 据此认为,AI 更像认知层面的垃圾食品,迎合当下却侵蚀人类数千年演化出的认知系统。
据 TechSpot 报道,一名佛罗里达女子使用 Claude 记录日记,Anthropic 将该日记内容报告给警方,该女子因此面临重罪指控。Hacker News 上该帖获得 731 分、563 条评论。
Hinton、Bengio等22位作者发表论文《What if automating AI R&D triggers an intelligence explosion?
量子位访谈了六位 FDE(前线部署工程师)从业者,发现他们的工作内容差异很大:有人驻场梳理企业 Ontology,有人基本不驻场只做线上技术对接,也有独立开发者一人接单做企业 AI 改造。
Latent Space 的 AINews 汇总了 10 月 1 日至 2 日的 AI 动态:OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元和 10 美元。
通过 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 接入由 Amazon 网页索引支持的 Web Search,覆盖数百亿文档,查询流量全程留在 AWS 内、无需外部 API key。
Anthropic 前沿红队评估智谱 GLM-5.3,认为它是首个能像五个月前 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎未设拒绝护栏就放出的模型。五个月前 Anthropic 发布 Claude Mythos Preview 时,曾称其是首个能自主构建复杂端到端漏洞利用的 AI 模型。
推荐理由:Anthropic 红队对 GLM-5.3 的评估显示其攻击能力接近 Claude Mythos Preview,但护栏缺失,可对照两份模型的安全策略差异。
OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 模式、Decisions API、ChatGPT Spaces 与 Marketplace,并称 ChatGPT 周活达 12 亿。
推荐理由:汇总了 DevDay 2026 的发布清单与第三方评测数据,可对照价格、基准与套餐变化判断实际取舍。
Anthropic 前沿红队在内部 Binary Exploitation 基准上随机选取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。
Anthropic 发布 Claude 5.5 家族第二个成员 Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上、多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。
推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅提升,为关注编码智能体选型的人提供了对比依据。
Laravel 框架宣布新规定,禁止用户提交 issue,只能提交 Pull Request,理由是 PR 能过滤垃圾反馈、给维护者更多信息,且 AI 时代让用户借 AI 生成 PR 几乎和提 issue 一样简单。