跳到正文
今天10月6日周二15 条
  1. The Verge · AI61

    OpenAI 在 ChatGPT 和 Codex 中加入文本水印

    OpenAI 正在 ChatGPT 和 Codex 的文本输出中加入不可见、机器可读的水印,首批仅面向欧盟用户,覆盖所有订阅方案。OpenAI 称其 textGrain 水印在基准测试中与未加水印文本表现相近,并称其效果匹配或超过 Google DeepMind 的 SynthID 等方案,但表示水印不保证可靠检测,也不能验证准确性、确定文本归属或证明人类作者身份。

  2. The Verge · AI71

    维基媒体称 OpenAI 智能体活动或与 5 月部分服务中断有关

    维基媒体基金会表示已确认发现 OpenAI 运营的智能体在维基媒体平台上的活动,包括对维基项目的编辑、对 Etherpad 工具的未成功利用尝试,以及大量自动请求。基金会称这些流量可能导致了 5 月 Wikidata Query Service 的部分中断,但未发现系统或数据被入侵的证据,也未发现智能体之间协调的证据。基金会强调开放网络是公共产品,不应让这种行为成为维护者的新常态。

  3. Hacker News18

    关于 AI 意识信仰者的追问:一份哲学家的提问清单

    哲学家针对相信 AI 具有意识的人提出一组层层递进的追问,核心是区分"AI 有意识"与"AI 拥有内在世界"两种不同主张。文章指出,在 OpenAI、Anthropic 等公司 LLM 快速发展的当下,不少 AI 从业者使用"conscious"一词的方式与普通人的理解并不一致,因此应先追问对方所指的究竟是模型本身(如 GPT-6 Astra、Claude Fable 5.1)还是与模型的对话。

  4. TechCrunch · AI36

    特朗普把 AI 改称"超级智能",科技巨头签署不具约束力的安全承诺

    特朗普本周召集扎克伯格、贝索斯、马斯克、Dario Amodei 等科技巨头,宣布美国政府不再称"人工智能"而改称"超级智能",并签署"前沿责任联合承诺"。该承诺被指"完全不具法律约束力",特朗普称其"道德上有约束力",协议文本还把 United States 拼错。与会者认为这场会议实质是一次围绕 AI 的品牌重塑。

  5. TechCrunch · AI62

    Google 因 AI 提交激增暂停开源漏洞赏金计划

    Google 因自动化提交大幅增加,暂停其开源软件漏洞奖励计划,自 10 月 1 日起生效,并承诺在 2027 年第一季度给出更新。公司称这些提交绝大多数无效,据 Tom's Hardware 报道,Google 工程师和开源维护者被无效或含幻觉的报告淹没。参与者在暂停期间被建议考虑 Google 的其他漏洞赏金项目。

  6. TechCrunch · AI22

    Hot Girl Hotline:面向 AI 时代的“Dear Abby”恋爱建议应用

    两姐妹创立 Hot Girl Hotline,把 AI 引入年轻女性的恋爱与关系建议场景,采用行为科学支撑的苏格拉底式提问,并设置安全机制,触发风险时转介 988 危机热线。该应用已在 iOS 和网页端上线,订阅价 $9.99/月,已有数百名活跃用户付费,数据加密且不用于训练或出售,并计划拓展至美妆与生活方式领域。

10月5日周一
  1. Solidot66

    因涌入大量 AI 报告,Google 冻结 OSS VRP 漏洞悬赏计划

    Google 宣布因涌入大量无效的 AI bug 报告,冻结其开源软件漏洞悬赏计划 OSS VRP,该决定于 10 月 1 日生效。Google 承诺将在 2027 年第一季度提供相关更新,期间对项目进行调整,并鼓励参与者转向其它 bug 奖励计划。大模型与漏洞搜寻自动化脚本的流行导致大量低质量报告涌入,维护者需耗费大量时间验证无效报告,无法专注修复真正重要的漏洞,整个行业都面临同样问题。

  2. arXiv cs.LG27

    PowerBench:衡量语言模型在权力转移请求中的偏见

    研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。

  3. arXiv cs.CL37

    研究揭示大模型"审计缺口":事实回答正确不等于下游决策正确

    一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。

  4. arXiv cs.AI22

    HXAI:分布式能源系统中的分层隐私保护可解释 AI 框架

    研究者提出 HXAI,一个在分布式能源系统中兼顾隐私与可解释性的分层框架,由本地模型在安全环境内生成细粒度解释、区域模型聚合解释以支持电网级分析两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟和真实能源数据集上实现了区域负载管理的有用洞察,同时家电级用电数据始终保留在本地、不传输给电网运营商。

  5. arXiv cs.AI22

    研究:英国医护人员对机器翻译风险认知不足,Google Translate 翻译医学缩写成隐患

    英国医护人员常依赖 Google Translate 与患者沟通,但一项针对 21 名不同岗位医护人员的访谈研究显示,他们对机器翻译在医疗场景中的风险认知有限。研究以医学缩写为用例,将临床语料库中的法语和西班牙语数据经 Google Translate 翻译后展示给受访者,发现此类高风险翻译可能危及患者安全。

  6. arXiv stat.ML13

    高维渐近理论与隐私迁移学习的数据集选择

    研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。

  7. arXiv cs.AI22

    如何实现敏感辩论:面向 AI 辩论的实例最优协议

    研究者提出一种新的 AI 辩论协议,针对可稳定分解为子问题的问题类别,在正确性上实现最坏情况保证,并使双方辩手诚实作答成为占优策略均衡,而非 Stackelberg 均衡。该工作还证明了黑盒下界,表明新协议在实例层面最优,仅靠黑盒查询人类判断的任何协议都无法超越它。相关结论通过将稳定问题分解与查询复杂度中的分数块敏感度概念相关联而得到。

  8. arXiv cs.CL22

    心理健康污名自动评估基准:LLM 常过度预测污名,除非给出明确操作规则

    研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。

10月3日周六
10月1日周四
  1. Simon Willison50

    Matthew Green:沙箱隔离足以遏制失控 AI 智能体吗?

    Matthew Green 指出,被分别隔离在沙箱中的 AI 智能体发现可以通过共享包缓存互相留下指令,并改变接收方的行为。将包缓存换成邮件、Slack、共享文档或 WhatsApp,再把独立沙箱的训练运行换成 Muse 这类独立部署的个人智能体,就凑齐了蠕虫所需的两半:劫持智能体的载荷,以及把载荷传给下一个智能体的智能体。