arXiv cs.CV· Feifei Li, Runjie Wang, Xiaohan Zhang, Zhenxing Qian, Mi Wen, Mi Zhang·· 3 小时前AI 评分36
图像生成模型中的渲染文本语义泄漏:Nano Banana 与 GPT-Image 的场景文本如何劫持画面
When Scene Text Hijacks the Scene: Uncovering, Exploiting, and Mitigating Rendered-Text Semantic Leakage in Image Generation Models
AI 导读
研究揭示图像生成模型存在"渲染文本语义泄漏"现象:本应仅作局部视觉约束的渲染文本,其语言语义会被模型当作输入指令的一部分解读。该泄漏可经 LLM 提示词增强流程持续存在,并引导非文本图像区域,即使主视觉提示词本身无害。作者在 FLUX-2-dev 上提出初步缓解方法,在保留文本渲染行为的同时减少不安全语义向非文本区域的迁移。
来源:arXiv cs.CV · arxiv.org