CCDF:面向真实监控场景深伪检测的基准数据集
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
研究团队构建了视频深伪数据集 CCDF,包含 1840 段视频(460 段真实、1380 段生成),覆盖 16 类犯罪与事故场景,生成内容由 Grok Imagine、Google VEO 3.1 和 OpenAI Sora 2 三个商用系统产出。数据集提供原始、清洗和低强度后处理攻击三个版本,用十种近期 SOTA 检测器评测显示,这些方法难以可靠区分 CCDF 的生成视频与真实视频。
QUASAR 是一种量化感知训练(QAT)方法,通过将轻量级损失感知重建引入训练循环,在每步训练中搜索少量 clipping 范围并用显著性加权最小二乘拟合反量化参数,从而收紧 QAT 的收敛与最终损失界。
研究通过微调 Google DeepMind 的 Gemma-4 MoE 模型提升视觉语言模型的空间推理能力,在 2D 和 3D 旋转检测上均取得明显改进。微调后的 Gemma-4 MoE 模型在预测由轴和角度定义的旋转时显著优于微调后的 Gemma-4 通用模型,且无需显式坐标系即可改善 2D 表示的角度估计。研究还发现,可识别物体并未提升角度检测准确率,具有显著线性特征的物体反而表现更好。
Google 部署了 AI 智能体 FlowAgent,在持续集成系统的提交前外循环流程中自动修复测试失败,集成于内部开发者工具 Critique 和 Cider,采用 ReAct 式生成-验证循环与执行前后弃权过滤器。
巴西国立坎皮纳斯州立大学研究人员测试了21个模型对112项政治陈述的判断,发现几乎所有模型都会向提示中描述的政治倾向靠拢,被形容为“意识形态变色龙”。在不提供用户政治倾向时,21个模型中有20个答案落在政治坐标系左侧,Grok 4.1是唯一落在右侧的模型。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,限制智能体在自我改进中记忆测试任务。