ChatGPT 在伪造的《纽约客》漫画上添加真实漫画家签名
ChatGPT 被发现在生成的仿《纽约客》风格漫画上添加真实漫画家的签名。该话题在 Hacker News 上获得 362 分和 265 条评论。
ChatGPT 被发现在生成的仿《纽约客》风格漫画上添加真实漫画家的签名。该话题在 Hacker News 上获得 362 分和 265 条评论。
OpenAI 为 ChatGPT 广告产品线新增视觉展示广告,广告将出现在用户要求生成的图像旁,本月起先在美国面向初始测试广告主上线,并明确标注且不影响 ChatGPT 给出的回答。
开发者发布小说转漫画 skill(github.com/aiskyhub/no…),为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并让程序按字体排入审过的对白、由生图模型专责画面,避免重绘改字。
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,将向上移动变为截断,从而避免模拟难以处理的逆时间过程。该方法证明了目标不变性,并在合成目标、生物分子玻尔兹曼采样和图像生成中取得有竞争力的精度与多样性,还能应用于现有 RE 校正无法处理的蒸馏采样器。
针对 Classifier-free guidance(CFG)缺乏显式判据、难以判断引导轨迹是否按预期推进的问题,研究者提出 Spectral Correction Guidance,通过将中间状态频谱与扩散前向过程的解析参考频谱对齐来校正采样偏差。
针对文本到图像生成的免训练安全防护,研究揭示全局不安全假设存在覆盖度与选择性的权衡:紧凑不安全子空间无法覆盖异构的不安全语义,而更广的聚合会扭曲安全邻近的良性提示词。
研究者提出秩感知投机采样(RASS),一种基于秩感知列表耦合的扩散草稿树验证规则,按提议-目标均值位移对草稿候选排序并采样秩权重,以最小化所选提议与目标分布的总变差。
MintFlow 是一个免训练的受限采样框架,将约束满足建模为对预训练流轨迹的最小干预,通过伴随公式得到扰动的闭式解,无需迭代优化。该方法还能自适应选择干预时机,在生成视觉与物理系统建模任务中,约束满足效果与 SOTA 受限方法相当,同时更好地保留预训练生成分布。
SatisDive 是一种免训练的推理时方法,通过批次相对奖励阈值区分高低奖励候选,在满足奖励下限的同时保证批次多样性。在 Pick-a-Pic 上,以 FLUX.1-dev 为基座模型、HPSv3 为奖励时,最差候选奖励较 FK steering 提升最高 0.43;以 SANA-1.6B 为基座、ImageReward 为奖励时提升最高 0.70。
研究提出一套自动化头皮分析与临床决策支持框架,结合毛囊单位定位、可见毛干计数、校准毛干宽度估计、区域聚合与可解释规则层,用于雄激素性脱发(AGA)评估。临床队列含 243 名患者(127 例 AGA、116 例非 AGA),计算机视觉实验使用 160 名专家标注患者、2,400 张毛发镜图像及约 158,000 条毛囊单位标注。
FactorSplat 是一种逐场景的 N 维高斯泼溅(N-DGS)代理,可在推理时接受区域特定的强度到 RGBA 曲线,让图像训练的高斯代理不再把单一传递函数烘焙进外观。
研究提出基于核典型相关分析(KCCA)的特征子空间对齐方法,并扩展为三视图 3vKCCA,将预训练文本编码器的投影纳入统一优化框架联合对齐。在 ImageNet-1K 上使用 CLIP ViT-L/14,3vKCCA 将 MMVP-VLM 准确率从 17.8 提升至 25.9,同时保持零样本图文检索性能。
AREX 是一种无需训练的采样器,可将预训练 Flow Matching 模型的采样动态分解为仿射分量与神经残差项,并用显式矩阵传播子对仿射部分做解析积分,仅对残差项做数值积分。在图像与文本到图像生成任务中,AREX 在少步采样下持续提升样本保真度,且无需重新训练底层模型。
SCION 是一种分层组合式场景表示,用可复用基元的紧凑词表加轻量级世界空间实例替代独立高斯,通过离散与连续场景参数的联合优化拟合多视图捕捉,在 1.2 MB 下仍保持高质量。它取得优于现有高斯压缩方法的率失真表现,并支持无需重训练的实例级场景编辑与动画,论文已被 NeurIPS 2026 接收。
MeshQuery 是一种免训练的智能体式自动 UV 展开方法,由 VLM 借助边选择工具规划符合艺术家习惯的接缝,并通过反馈循环迭代优化。在 Adobe Substance 3D 和 Toys4K 网格上,其生成的 chart 数量比最强基线少 2.9x/4.29x,接缝长度短 1.63x/1.7x,专业艺术家在 80.9% 的对比中更偏好其结果。
DAGS 是一种轻量、无注意力机制的解耦外观与几何条件方案,可引导冻结的图像 DiT 生成高保真、高一致且可独立控制的渲染结果。它用两个小型卷积编码器逐帧计算条件特征,并以逐层逐元素的残差注入图像 token,避免注意力堆叠条件的二次开销。
伯克利 AI Research 提出基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,在彩色摄影、射电天文、无镜头成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计可媲美端到端 SOTA 方法,同时占用更少内存和算力,且无需任务专用解码器。相关论文发表于 NeurIPS 2025。