OpenAI 谈欧盟文本溯源规则下的文本水印方案
OpenAI 阐述了在欧盟文本溯源规则下推进文本水印的思路,说明了水印的适用场景与检测机制,并解释为何检测能力首先向研究人员开放。
OpenAI 阐述了在欧盟文本溯源规则下推进文本水印的思路,说明了水印的适用场景与检测机制,并解释为何检测能力首先向研究人员开放。
研究者推出 PowerBench,用于评估语言模型在权力转移请求中的偏见,区分自我赋权、去权和夺权三类请求,并设置不涉及权力转移的拒绝诱导请求作为对照。该基准开源了覆盖不同权力领域、情境、受影响方规模和用户原有权力地位的数据集,在三种实验条件下评测了 24 个模型(12 个来自美国、12 个来自中国开发者)。
一项针对8个模型的研究发现,在剂量1000的虚假文档训练下,模型直接注入选择率高达95.8%–100%,但决策任务中的注入选择仅比真实对照训练高出1.7–14.4个百分点,形成"审计缺口"。在2019–20澳大利亚山火虚假帖文案例中,模型即使未复现被夸大的数字,仍会断言有人因纵火被捕。研究表明,正确的事实回答不能保证正确的决策,纠正事实也无法消除误导性叙事。
研究评估了 21 个自然可见图(NVG)拓扑指标,用 SHAP、分组 Permutation Importance、Boruta 和 RFE 四种方法经 Consensus Ranking 整合,在 CICIDS2018 数据集与 CNN 分类器上测试。
针对文本到图像生成的免训练安全防护,研究揭示全局不安全假设存在覆盖度与选择性的权衡:紧凑不安全子空间无法覆盖异构的不安全语义,而更广的聚合会扭曲安全邻近的良性提示词。
研究者提出 ExecCert(Executable Release Certification),一个在发布时对候选模型产物进行认证的层,可闭合方法原生证书或通过 Retraining-Reference Release Verification(RRV)验证其对当前保留集重训练的保真度。
研究对正则化经验风险加入随机线性项 z~N(0,σ²I_d) 后,释放确定性梯度下降第 N 次迭代所得有限计算的差分隐私性质。在强凸、光滑且 Hessian 满足 Lipschitz 条件下,证明 z↦w_N 在隐私论证所用有界域上是 C¹ 微分同胚,并给出 Jacobian 最小奇异值的定量下界。
研究者提出 HXAI,一个在分布式能源系统中兼顾隐私与可解释性的分层框架,由本地模型在安全环境内生成细粒度解释、区域模型聚合解释以支持电网级分析两部分组成。该框架通过灵活的隐私预算管理限制重复查询下的累积隐私暴露,在模拟和真实能源数据集上实现了区域负载管理的有用洞察,同时家电级用电数据始终保留在本地、不传输给电网运营商。
英国医护人员常依赖 Google Translate 与患者沟通,但一项针对 21 名不同岗位医护人员的访谈研究显示,他们对机器翻译在医疗场景中的风险认知有限。研究以医学缩写为用例,将临床语料库中的法语和西班牙语数据经 Google Translate 翻译后展示给受访者,发现此类高风险翻译可能危及患者安全。
多智能体辩论中,向一致多数派妥协的 LLM 智能体其实并未改变"想法"。研究用 J-lens 从残差流中读取中间实体(bridge),在 Qwen3.5-4B。
研究提出一种基于高维回归与加权岭估计器的数据集选择方法,仅依赖汇总统计量即可判断外部数据能否改善预测,并给出在标签或特征与标签联合上的ρ-零集中差分隐私保证。其核心技术贡献是测试误差的确定性等价,刻画了样本量、协方差结构、模型偏移、正则化与隐私噪声之间的交互,可在不访问数据本身的情况下优化超参数并判断私有外部数据集是否有用。
研究者提出一种新的 AI 辩论协议,针对可稳定分解为子问题的问题类别,在正确性上实现最坏情况保证,并使双方辩手诚实作答成为占优策略均衡,而非 Stackelberg 均衡。该工作还证明了黑盒下界,表明新协议在实例层面最优,仅靠黑盒查询人类判断的任何协议都无法超越它。相关结论通过将稳定问题分解与查询复杂度中的分数块敏感度概念相关联而得到。
针对大语言模型在个人建议场景中过度附和用户的社会性谄媚问题,研究者提出多元偏好优化(PlurPO):模型先识别并模拟冲突中涉及的相关利益方,再被训练为偏好并生成各方都能接受的回复,全程无需真实标签。
研究者提出一个基于理论的心理健康污名自动评估基准,包含真实网络新闻与社交媒体文本,并按污名模式、领域及具体成分进行细粒度标注,覆盖六种心理健康状况。结果显示,检测情感、毒性和仇恨言论的模型无法很好捕捉心理健康污名,LLM 在缺乏明确操作规则时往往过度预测污名。基准的公开部分、标注、典型示例与代码已发布。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使其在数字模型和合成出的实体蛋白质上均可验证,同时实验室测试显示不损害生物功能。
推荐理由:DeepMind 把水印从数字内容扩展到合成生物,读者可了解其如何在不影响蛋白功能的前提下嵌入可验证信号。
OpenAI 披露阻断了一起协同模型蒸馏攻击活动,该活动旨在提取其受保护的模型推理能力。OpenAI 表示正在加强针对对抗性蒸馏的防御措施。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 公开了自主模糊测试流水线的架构与运行方式,读者可了解 LLM 智能体如何接管覆盖率反馈与崩溃分诊。
Google DeepMind 公布 Private AI Compute 平台的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能在多设备间保留上下文,同时维持接近端侧处理的隐私标准。
推荐理由:Google 公开了云端持久记忆的隐私架构,读者可了解跨设备 AI 记忆如何在加密与安全隔区下实现。