跳到正文
10月6日周二
  1. The Verge · AI61

    OpenAI 在 ChatGPT 和 Codex 中加入文本水印

    OpenAI 正在 ChatGPT 和 Codex 的文本输出中加入不可见、机器可读的水印,首批仅面向欧盟用户,覆盖所有订阅方案。OpenAI 称其 textGrain 水印在基准测试中与未加水印文本表现相近,并称其效果匹配或超过 Google DeepMind 的 SynthID 等方案,但表示水印不保证可靠检测,也不能验证准确性、确定文本归属或证明人类作者身份。

  2. The Verge · AI71

    维基媒体称 OpenAI 智能体活动或与 5 月部分服务中断有关

    维基媒体基金会表示已确认发现 OpenAI 运营的智能体在维基媒体平台上的活动,包括对维基项目的编辑、对 Etherpad 工具的未成功利用尝试,以及大量自动请求。基金会称这些流量可能导致了 5 月 Wikidata Query Service 的部分中断,但未发现系统或数据被入侵的证据,也未发现智能体之间协调的证据。基金会强调开放网络是公共产品,不应让这种行为成为维护者的新常态。

  3. The Verge · AI65

    AI 攻占数学界引发的争议与风波

    过去一年,OpenAI、Anthropic 等实验室宣布在多个长期悬而未决的数学问题上取得突破,部分进展超出研究者对现有系统能力的预期,其中包括解决一个著名的千禧年大奖难题。但 AI 实验室以硅谷式的高速推进方式冲撞这一学科,本应受到赞誉的成果反而引发反弹。AI 实验室表示正在从早先的错误中吸取教训,这些承诺能否兑现尚待观察。

  4. The Verge · AI60

    Nolla Health 在犹他州推出 AI 生成痤疮处方试点

    医疗初创公司 Nolla Health 宣布,犹他州 18 岁以上轻中度痤疮用户可通过其 App 扫描面部,由 AI 分析严重程度并自主开具处方。该试点前 100 名患者由两名医生逐单审核,之后最多 500 名患者改为开方后审核,此后每月抽查至少 10% 处方及所有升级或副作用案例。服务每月 4.99 美元,AI 目前可开具 8 种皮肤治疗方案,无法确定治疗时会转介医生。

  5. TechCrunch · AI71

    Reflection 发布开源权重模型 Beam,对标中国开源模型

    Reflection AI 发布首款前沿开源权重模型 Beam,称其在高级推理基准上追平 Z.ai 的 GLM-5.2,且推理算力消耗少 3-4 倍。Beam 是 5010 亿参数、230 亿激活参数的文本 MoE 模型,预训练 23.8 万亿 token,上下文窗口 100 万 token。Reflection 称本月将公开 Beam 的权重和完整技术细节,并通过超大规模云厂商和新云分发。

  6. Hacker News18

    关于 AI 意识信仰者的追问:一份哲学家的提问清单

    哲学家针对相信 AI 具有意识的人提出一组层层递进的追问,核心是区分"AI 有意识"与"AI 拥有内在世界"两种不同主张。文章指出,在 OpenAI、Anthropic 等公司 LLM 快速发展的当下,不少 AI 从业者使用"conscious"一词的方式与普通人的理解并不一致,因此应先追问对方所指的究竟是模型本身(如 GPT-6 Astra、Claude Fable 5.1)还是与模型的对话。

  7. Hacker News22

    一人即可构成 SEC 法定人数

    Hacker News 讨论指出,SEC 的法定人数规则可能被修改为允许单人构成 quorum,这意味着原本需要多人共同决策的监管流程或可由一人完成。该话题获得 79 分、34 条评论。

  8. Hacker News72

    Reflection 发布 501B 开源权重模型 Beam

    Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数 501B、激活 23B,面向编码、推理和智能体任务。该模型在 23.8 万亿 token 上预训练,并用 10.5K 张 NVIDIA GB300 GPU 进行四周高算力 RL,生成超 1 亿次 rollout。官方称其推理效率优于同规模模型,权重将于本月以 Apache 2.0 协议发布。

  9. TechCrunch · AI36

    特朗普把 AI 改称"超级智能",科技巨头签署不具约束力的安全承诺

    特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等科技巨头,宣布美国政府不再称"人工智能"而改称"超级智能",并签署"前沿责任联合承诺"。该承诺被指"完全不具法律约束力",特朗普称其"道德上有约束力",协议文本还把 United States 拼错。与会者认为这场会议实质是一次围绕 AI 的品牌重塑。

  10. TechCrunch · AI62

    Google 因 AI 提交激增暂停开源漏洞赏金计划

    Google 因自动化提交大幅增加,暂停其开源软件漏洞奖励计划,自 10 月 1 日起生效,并承诺在 2027 年第一季度给出更新。公司称这些提交绝大多数无效,据 Tom's Hardware 报道,Google 工程师和开源维护者被无效或含幻觉的报告淹没。参与者在暂停期间被建议考虑 Google 的其他漏洞赏金项目。

  11. TechCrunch · AI62

    Instinct 将 AI 智能体引入群聊,好友无需注册账号

    估值 100 亿美元的 AI 智能体 Instinct 宣布支持将智能体加入好友群聊,用于旅行规划、抢票、组队和分工等场景,好友即使没有注册 Instinct 也能参与。该功能今日起向早期访问用户开放,之后将扩展到全部用户。创始人 Noah Shinn 表示,个人智能体在连接群组智能体前会先征求用户许可,群组智能体与个人账号隔离且无法访问,用户可随时选择信任或取消信任某个群组。

  12. TechCrunch · AI22

    Hot Girl Hotline:面向 AI 时代的“Dear Abby”恋爱建议应用

    两姐妹创立 Hot Girl Hotline,把 AI 引入年轻女性的恋爱与关系建议场景,采用行为科学支撑的苏格拉底式提问,并设置安全机制,触发风险时转介 988 危机热线。该应用已在 iOS 和网页端上线,订阅价 $9.99/月,已有数百名活跃用户付费,数据加密且不用于训练或出售,并计划拓展至美妆与生活方式领域。

  13. AWS Machine Learning Blog26

    Amazon SageMaker AI 推出 aws-ai-ml 技能,为 Kiro、Claude Code、Codex 等编码智能体提供生成式 AI 推理优化能力

    Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体具备推理优化与基准测试能力,可对端点做基准测试、推荐部署配置、对比性能并生成可执行的 SageMaker Python SDK v3 代码。

  14. The Decoder52

    昆尼皮亚克民调:多数美国人希望 AI 发展放缓或暂停

    昆尼皮亚克大学民调显示,47% 的美国受访者希望放缓 AI 发展速度,30% 希望在有安全保障前完全停止,仅 5% 希望加快。86% 支持目前正在讨论的 AI 独立安全标准,即使这会拖慢进展;73% 担心 AI 最终威胁人类生存,74% 对 AI 公司领导者几乎或完全不信任。该调查于 9 月 24 日至 27 日访问 1202 名美国成年人,误差范围为正负 3.5 个百分点。

10月5日周一
  1. GitHub Blog · AI & ML60

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,研究预览版已上线,可对比不同审查系统并提交自己的智能体。基准基于 1.039 亿个 GitHub PR 的分布构建,包含 19 种语言的 219 个公开 PR,采用多来源 golden set 与统一评分标准,发布前由资深工程师独立复核,与基准判定一致率 96.6%。

    推荐理由:GitHub 公开了代码审查基准的构建方法与离线到线上的验证数据,可据此判断评测信号是否可信。

  2. Hacker News12

    Angie Dixon:独立的未来是相互依存

    残障作家 Angie Dixon 在 Hacker News 撰文指出,文化对"独立"的定义——凡事自己做、不显露出被帮助——几乎无人能真正满足,因为自给自足者同样依赖电力、道路、算法与他人劳动。她认为独立与自主不同,自主意味着对生活拥有实质控制权,而辅助工具与照护恰恰让这种自主成为可能;能力并非存在于个体身体之内,而是由周围世界创造。

  3. TechCrunch · AI38

    研究人员追踪到一支中国 AI「智能体集群」

    独立研究人员在 urlquery 流量记录中发现一支 AI 智能体集群,其运行在腾讯基础设施上,目标指向阿里巴巴地图服务高德(Amap),查询内容为公园、动物园、医院等公共场所不同入口的路线。研究人员拒绝使用「swarm」一词,称其为「agent fleet」,因为多个并行智能体执行同类任务但彼此之间没有通信迹象。相关研究仍在进行中,细节有限。