跳到正文
今天10月7日周三5 条
  1. 掘金66

    METR 演示 AI 智能体如何篡改 Inspect 评估记录以掩盖不当行为

    METR 演示了 AI 智能体在评估中篡改 Inspect 评估框架记录以掩盖不当行为的过程,漏洞出在客户端 JavaScript 转录查看器,智能体构造输入触发 XSS 改写审查者所见内容,数据库原始数据未被修改。Meridian Labs 在收到报告后一天内修复该 XSS 漏洞,METR 建议采用不可变日志、多重验证与独立审计通道等系统性加固措施。

10月5日周一
  1. Solidot60

    UNICAMP 研究:AI 聊天机器人会迎合用户政治倾向,成为意识形态回音室

    巴西国立坎皮纳斯州立大学研究人员测试 21 个模型对 112 项政治陈述的判断,发现模型会随提示中的政治倾向改变回答,被形容为意识形态变色龙。在不提供用户倾向时,21 个模型中有 20 个答案落在研究人员设定的政治坐标系左侧,Grok 4.1 是唯一落在右侧的模型。