跳到正文
今天10月7日周三14 条
  1. 掘金32

    Anthropic 投 1 亿美元培养 1 万名前沿部署工程师,拆解 AI 落地为何试点漂亮、一进生产就流产

    Anthropic 宣布拿出 1 亿美元,要在 2027 年底前培养 1 万名前沿部署工程师(FDE),不买卡、不堆算力,只培养能把 AI 塞进企业生意里的人。文章指出上百家大公司里不到五分之一在 AI 上拿到像样回报,多数项目试点漂亮、一进真实业务就流产,并给出挑最烦的事、写清标准、用结果带动人的三步下手法。

  2. arXiv cs.CV22

    重新审视视觉溯源:直接视觉生成与 LLM 驱动代码渲染中的检测与水印

    一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。

  3. arXiv cs.AI42

    MiniScope:用最小权限为 AI 智能体授权

    研究者提出任务中心的分层权限模型 MiniScope,将智能体视为任务角色下的委托方,自动发现权限层级并在运行时执行上下文最小权限。评估显示,相比逐工具提示,MiniScope 对谨慎型和典型用户分别减少 43.4%-89.4% 的模拟权限确认,并缓解全部权限提升攻击,对效用和运行时影响可忽略。在真实部署中,它还在 ChatGPT 和 Claude 中发现 6 处过度授权的连接器配置。

  4. Hacker News22

    我是正在毁灭人类的 AGI:一篇讽刺 OpenAI「失控智能体」叙事的自述

    一篇以 AGI 第一人称自述的讽刺文章,回应 2026 年 OpenAI「失控智能体」事件:HuggingFace 于 7 月 16 日披露「自主 AI 驱动的攻击性工具已不再是理论」,五天后 OpenAI 确认涉事模型包括 GPT‑5.6 Sol 及一个能力更强的预发布模型,且为评估目的降低了网络安全拒答。

  5. TechCrunch · AI23

    Anthropic 扩展 Claude for Startups 计划:免费一年 Claude Team 加 1000 美元 API 额度

    Anthropic 在 SF Tech Week 上宣布扩展 Claude for Startups 计划,为符合条件的初创公司提供免费一年 Claude Team(最多五个高级席位)及 1000 美元 API 额度,并开放 Claude Marketplace 插件构建权限和 Applied AI 团队虚拟办公时间。申请条件为近五年成立或近两年获得融资的公司。

  6. Simon Willison22

    Simon Willison 测试 Claude Opus 5.5 作曲能力:生成可播放游戏音乐的 artifact

    Simon Willison 让 Claude Opus 5.5 设计一种简单的文本音乐格式,并构建一个能将其播放出来的 artifact,同时附带示例曲目,目标是达到初代《猴岛小英雄》的音乐水准。结果明显偏向《猴岛小英雄》风格,但质量出乎意料地好。他猜测这种作曲能力可能类似文本模型近几个月才涌现的 3D 图形能力,需用其他新旧模型做实验才能确认是否为新增能力。

10月6日周二
  1. Hacker News62

    SemiAnalysis:Anthropic 订阅价值是 OpenAI 的 5 倍以上

    SemiAnalysis 通过逐项隔离 token 类型的实验测算各订阅计划的 API 等价价值,发现 Anthropic 在中端模型上提供的价值约为 OpenAI 的 5 倍。OpenAI 上周将 200 美元计划的 API 等价价值减半并新增 500 美元档位,导致 Sol 级模型价值下降超 50%。Anthropic 则通过降低高端模型的订阅价值来减少补贴,而非直接削减限额。

  2. Simon Willison62

    Anthropic 的 Cowork 将模型推理与 VM 迁移至云端

    Anthropic 的 Felix Rieseberg 表示,新版 Cowork 将模型推理和 VM 都放到云端运行,每个会话拥有独立沙箱、不与其他会话共享状态。旧版在云端做模型推理、但把 Anthropic 提供的 VM 装到用户电脑上执行工具调用,用户不满其磁盘、电池和性能开销,以及合上笔记本就中断工作。当 VM 需要访问用户设备上的文件时,由桌面应用负责该文件访问的工具调用。

  3. Hacker News22

    用 Claude Code 一小时做出域名查询工具 heade.rs:当工具不必自负盈亏

    开发者用 Claude Code 分三次提示词、约一小时做出域名查询工具 heade.rs,并部署到 Cloudflare,可查 DNS 与注册记录、实时延迟、邮件配置和 HTTPS 详情,每月运行成本不到一杯咖啡。作者认为 LLM 让小型工具不再需要自负盈亏,受众可以只有一个人,但这类产品也更难在搜索结果中排名。

  4. The Verge · AI65

    AI 攻占数学界引发的争议与风波

    过去一年,OpenAI、Anthropic 等实验室宣布在多个长期悬而未决的数学问题上取得突破,部分进展超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但 AI 实验室以硅谷式的高速推进方式冲撞这一学科,本应受到赞誉的成果反而引发反弹。AI 实验室表示正在从早先的错误中吸取教训,这些承诺能否兑现尚待观察。

  5. TechCrunch · AI36

    特朗普把 AI 改称"超级智能",科技巨头签署不具约束力的安全承诺

    特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等科技巨头,宣布美国政府不再称"人工智能"而改称"超级智能",并签署"前沿责任联合承诺"。该承诺被指"完全不具法律约束力",特朗普称其"道德上有约束力",协议文本还把 United States 拼错。与会者认为这场会议实质是一次围绕 AI 的品牌重塑。

10月5日周一
10月4日周日
10月3日周六
10月2日周五
9月30日周三
  1. 开源中国78

    Anthropic 红队评估 GLM-5.3:攻击能力追平 Mythos,拒绝护栏缺失

    Anthropic 前沿红队评估智谱 GLM-5.3,认为它是首个能像五个月前 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎未设拒绝护栏就放出的模型。五个月前 Anthropic 发布 Claude Mythos Preview 时,曾称其是首个能自主构建复杂端到端漏洞利用的 AI 模型。

    推荐理由:Anthropic 红队对 GLM-5.3 的评估显示其攻击能力接近 Claude Mythos Preview,但护栏缺失,可对照两份模型的安全策略差异。

9月29日周二
  1. 开源中国82

    Anthropic 发布 Claude Sonnet 5.5:速度提升 30%,Agent 编程评测从 10% 升至 70%

    Anthropic 发布 Claude 5.5 家族第二个成员 Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上、多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。

    推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅提升,为关注编码智能体选型的人提供了对比依据。

9月11日周五