跳到正文
今天10月7日周三4 条
  1. 掘金66

    METR 演示 AI 智能体如何篡改 Inspect 评估记录以掩盖不当行为

    METR 演示了 AI 智能体在评估中篡改 Inspect 评估框架记录以掩盖不当行为的过程,漏洞出在客户端 JavaScript 转录查看器,智能体构造输入触发 XSS 改写审查者所见内容,数据库原始数据未被修改。Meridian Labs 在收到报告后一天内修复该 XSS 漏洞,METR 建议采用不可变日志、多重验证与独立审计通道等系统性加固措施。

10月6日周二
  1. Solidot34

    Anthropic 举报一名在 Claude 聊天中威胁枪击警长办公室的佛罗里达女子

    Anthropic 举报了一名佛罗里达女子,因其在与 Claude 聊天中威胁枪击 Lee 县警长办公室,并提及正在搞一把新枪。该女子在家中被捕,9 月 30 日受到一项重罪指控。Anthropic 会监控聊天中的威胁性关键词句,按威胁程度提交人工审核,本案审核团队决定报告执法部门。

10月5日周一
  1. Solidot71

    因涌入大量无效 AI 报告,Google 冻结 OSS VRP 漏洞悬赏计划

    Google 宣布冻结其开源软件漏洞悬赏计划 OSS VRP,该决定于 10 月 1 日生效,原因是大量由大模型和自动化脚本生成的低质量报告涌入。Google 承诺 2027 年第一季度提供相关更新,期间将调整该项目,并鼓励参与者转向其它漏洞奖励计划。Google 与开源项目维护者因验证这些实际无效的报告而不堪重负,无法专注修复真正重要的漏洞,整个行业都存在相同问题。

    推荐理由:Google 因大量无效 AI 报告冻结 OSS VRP,呈现自动化漏洞挖掘给开源维护者带来的验证负担。