跳到正文
今天10月7日周三131 条
  1. arXiv cs.CV33

    深度伪造检测的缩放定律研究:ScaleDF 数据集与幂律规律

    研究系统分析了深度伪造检测中的缩放定律,发现检测平均误差随真实图像域数量或伪造生成方法数量增加呈可预测的幂律衰减,类似大语言模型的缩放规律。为此构建了 ScaleDF 数据集,包含来自 51 个数据集的超 580 万张真实图像和 102 种方法生成的超 880 万张伪造图像。该规律可用于预测达到目标性能所需的额外域或方法数量,并以数据为中心应对不断演进的深度伪造技术。

  2. arXiv cs.CV22

    重新审视视觉溯源:直接视觉生成与 LLM 驱动代码渲染中的检测与水印

    一篇概念性研究议程论文提出以生产为中心的框架,对比直接图像/视频生成与 LLM 写代码渲染两条路径下的检测与水印,并按生产阶段组织图像、视频、源码与渲染感知水印。框架区分被动推理、消息恢复与认证溯源,结合 Claude、OpenAI 及渲染工具接口提出十个研究问题,涵盖可识别性、可观测性、可恢复载荷、同步与合成等。论文共 46 页,不含实验,不主张新定理。

  3. arXiv cs.CV29

    CCDF:面向真实监控场景深伪检测的基准数据集

    研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。

  4. arXiv cs.CV24

    SRIM:面向恶意编辑的尺度鲁棒图像免疫保护扰动方法

    针对保护性扰动在照片缩放后失效的问题,研究者提出 SRIM,通过采样覆盖全尺度范围的锚点尺度并按当前最弱尺度加权,提升未知缩放下的最差情况防护。在 9 至 30 百万像素全分辨率照片、2 至 8 倍下采样条件下,SRIM 将 FLUX.2-klein 编辑的最差情况扰动从最强已发表保护的 0.192 LPIPS 提升至 0.463,同等可见度下防护约翻倍。

  5. arXiv cs.CL22

    WinoQueer-NL:评估荷兰语模型对 LGBTQ+ 群体的偏见

    研究者基于英文 WinoQueer 基准构建了荷兰语数据集 WinoQueer-NL,最终包含 42,906 条句子,用于评估荷兰语及多语言模型对 LGBTQ+ 群体的偏见。经 43 名荷兰酷儿参与者调查,171 条刻板印象中 145 条被确认具有文化相关性,并新增 22 条偏见。模型平均偏见分约 50%,但部分模型对跨性别身份有高达 97% 的概率偏向刻板句子,对男同性恋相关句对仅 6%。

  6. arXiv cs.LG22

    CLAD:面向神经网络验证的约束抽象域

    研究者提出约束拉格朗日抽象域(CLAD),可在由凸约束组合定义的输入区域上对神经网络计算可靠的过近似,并通过投影原始-对偶方法求解拉格朗日乘子下的 max-min 问题。在 4 个卷积网络、1,944 个实例的评测中,CLAD 在标准无约束 Linf 属性上与 GCPCROWN 验证数量相当且运行时间相近,在 L2-ball 约束属性上比 GCPCROWN 多验证 60% 的实例,整体多 22%。

  7. arXiv cs.CL24

    缺失的最小对:LLM 中的刻板印象评估

    针对大语言模型偏见评估中单对对比句不可靠的问题,研究者提出双最小对(dual minimal pair)评估框架,通过改写与替换属性生成英文、俄语、西班牙语和中文的刻板印象数据,并设计两项评估指标,其中一项基于社会群体与刻板属性间互信息(MI)的新指标更适合跨语言、跨模型聚合比较。代码已开源。

  8. arXiv cs.CL39

    LLM 会把闲聊和背景语音写进病历,干扰临床推理

    研究测试了 LLM 对患者就诊无关信息的敏感性:在 576 段医患对话中,前沿模型把闲聊写进 35% 的病历,3.7% 的病例中模型误用或误归属这些题外话。在 57 段模拟录音中,-10 dB 的另一场就诊背景语音泄漏进 48.2% 的转录文本,四个开源权重模型生成的病历有 5.3% 被检出污染。作者提出临床推理与干扰的双重编码假说,建议临床使用前评估模型对无关信息的抵抗力。

  9. arXiv cs.CL29

    幻觉检测基准中的标注问题:一项实证评估

    研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。

  10. arXiv cs.LG22

    多目标对齐中的跨目标干扰:COVER 重加权方法研究

    研究首次系统分析了 LLM 多目标对齐中"跨目标干扰"现象——标量化训练只提升部分目标而其他目标退化,该现象普遍存在但强依赖模型。作者推导出局部协方差定律,并据此提出 COVER(协方差下限强制重加权)控制器,仅在目标奖励与标量化分数的协方差低于阈值时提升其权重。实验表明 COVER 能缓解干扰,且在目标已协同改善时与线性标量化持平。

  11. arXiv cs.CL25

    读取而非操控:用 Router Logits 为 MoE 视觉语言模型做多模态安全检测

    研究者提出一种轻量级 router-logit 安全检测器,在 prompt prefill 阶段读取 MoE 视觉语言模型的 routing 信号,在生成前识别不安全请求,无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 上,该检测器大幅降低 HoliSafe 基准上的安全错误,并泛化到 MISHard 和 MM-SafetyBench 等分布外安全基准。

  12. arXiv cs.CL22

    通过击键动态检测 LLM 辅助的越南语写作:行为操纵下的鲁棒性研究

    研究构建了越南语击键数据集,涵盖真实写作、转录和改写三种模式,并设计了用户刻意改变打字模式的行为操纵威胁模型。在用户无关和上下文无关设置下,基于 1D-CNN 和 TypeNet 的序列模型在多数情况下优于时序与节奏特征方法,但转录可被可靠识别,改写和对抗操纵样本常被误判为真实写作。引入行为操纵数据的对抗训练后,可分离性和鲁棒性显著提升。

  13. arXiv cs.CL22

    儿童手语翻译安全审计:SLT 与儿童安全防护的交叉评估缺失

    自动手语翻译(SLT)已进入消费产品,但尚无公开系统将 SLT 与儿童安全防护工具联合评估,主流已部署 SLT 模型也未在 18 岁以下手语者上训练或正式评测。否定、角色、保密、紧急或求助等翻译错误可能在不影响流畅度的情况下改变安全判定。论文提出一套由聋人群体参与部署前审计框架,含失败分类、场景模板、四种比较条件和四项结果指标,计划以 Auslan 为首个案例。

  14. arXiv cs.CL29

    如何从模型内部识别真实内省:LLM 自我报告的机制特征研究

    研究者用低秩适配器训练模型按隐含线性偏好函数为虚构角色做决策,发现持续微调能让模型在无显式自我报告监督下准确报告自身学到的偏好。权重消融与冻结层实验显示偏好表征随训练前移至更早层,而 attribution patching 发现忠实模型的决策与自我报告任务间归因相似度显著更高,可作为区分忠实与不忠实自我报告的机制特征。

  15. arXiv cs.LG23

    大语言模型强化学习置信度校准中奖励函数的有效性研究

    研究探讨用强化学习训练大语言模型同时提升推理准确率并输出置信度时,奖励函数设计不当会诱发"置信度奖励黑客"现象,即模型为让置信度显得校准而故意答错。作者提出"不可黑客攻击的置信度奖励方案"概念及构造方法,并证明可攻击方案在实际数据集上会出现选择性奖励黑客,而不可攻击方案能抵抗该问题。实验还表明不同方案在过度自信—信心不足谱系上呈现相应的校准偏差。

  16. arXiv cs.LG29

    稀疏自编码器(SAE)能学到有意义的概念层级吗?

    研究针对稀疏自编码器(SAE)的无监督概念发现,提出了一套面向泛化/特化层级的关键要求与具体评估协议。在视觉数据上训练的现有 SAE 方法显示,特征空间虽普遍具备合理层级的基础,但建立良好层级结构仍具挑战。特征吸收(包括硬形式和连续的软形式)会系统性损害层级质量,揭示出未来方法需应对的根本性张力。

  17. arXiv cs.LG22

    为解释算法连接真实世界:Explanation Cards 的提出

    针对算法解释常需专业知识才能正确理解、且主流解释算法对复杂决策函数信息量不足的问题,研究者提出 Explanation Cards for Explanation Algorithms,在标准解释上补充鲁棒性与有效性信息及明确的解读说明。以反事实解释和 SHAP 为例,该卡片将解读责任从用户转移给提供方,并被认为可用于落实 EU AI Act 的可解释性条款。

  18. arXiv cs.LG17

    基于代理的机器遗忘的行为保证

    该论文提出一个统一框架,将近期基于代理的机器遗忘方法推广,并证明遗忘后模型行为与保留数据理想后验分布之间的 KL 散度上界。方法将近似遗忘建模为约束优化问题,通过后验数据分布的代理引入缩放遗忘信号,必要时以目标模型为教师蒸馏权重更新。在两个遗忘场景实验中,该方法得到的分类器最接近从头重训的模型。

  19. arXiv cs.LG36

    多轮 LLM 的答案侧后门攻击:模型自生成触发词绕过安全拒答

    研究者提出一种面向多轮对话的答案侧后门攻击,不再把触发词放进用户输入,而是用无害的首轮提示诱导模型自己生成一个看似无害的词,该词进入对话历史后即成为触发词。当后续有害提问到来时,模型识别到自身生成的触发词便绕过安全拒答,而用户输入始终干净。在四个 LLM 上,仅 5% 投毒率即达到接近 100% 的攻击成功率,同时保持通用能力和干净输入下的安全性,并能规避主流以输入为中心的防御。

  20. arXiv cs.LG17

    交错投影梯度下降:面向安全模仿学习的神经网络控制策略

    研究者提出一种交错投影梯度下降的模仿学习方案,训练时在标准模仿梯度步之间插入 k 步安全修正,将网络动作拉向安全集投影,运行时仅用训练好的网络、无需安全滤波器。在非线性自动驾驶赛车任务中,该方法在足够大的权重下达到无约束模仿的圈速,同时将违规回合比例从 15% 降至 1%,约为惩罚方法最佳权重的六分之一。代价是额外的训练计算量。

  21. arXiv cs.LG17

    鲁棒 bandits 的计算可解性研究:识别多项式时间可学习特例并证明其小推广为 NP-hard

    针对鲁棒 bandits(原 imprecise bandits)此前只有 Θ(√T) 遗憾保证而无计算保证的问题,研究者识别出一个可用多项式时间学习器实现 Õ(√T) 遗憾的特例,并证明该特例的若干小推广均为 NP-hard,表明其处于可解性边界。作者称这是朝着用计算高效学习器解决 AI 对齐问题方向的一小步。

  22. arXiv cs.LG26

    研究揭示基于潜空间的水印方法固有鲁棒性局限

    针对扩散模型的潜空间水印方法,一项理论分析首次解释了这类方法为何对旋转、缩放、平移等图像扰动缺乏不变性,并推导出刻画像素空间扰动与潜空间响应关系的最大扰动界。研究还首次给出覆盖实际检测机制各组件的解析形式,实验验证了理论结论:在当前设计范式下,基于潜空间的水印方法固有地表现出有限鲁棒性。

  23. arXiv cs.LG13

    多群体公平性与 Omniprediction:分离与等价关系

    研究探讨 omniprediction 是否必须依赖多群体公平性,结论是:普通 omniprediction 不需要,而 loss OI 需要。作者证明,针对 proper losses 的 omniprediction 甚至不蕴含期望准确率,从而排除了多校准或校准多准确率的弱逆命题;同时证明 loss OI 等价于一种校准多准确率。该成果已被 NeurIPS 2026 接收。