跳到正文
arXiv cs.AI· Tobias Braun, Jonas Henry Grebe, Hossein Shakibania, Anna Rohrbach, Marcus Rohrbach·· 3 小时前AI 评分41

统一自回归模型的后门漏洞:ToBAC 攻击可跨模态传播恶意效果

Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models

AI 导读

研究者首次揭示统一自回归模型(UAMs)存在多模态后门攻击漏洞,并提出 ToBAC 攻击方法,可通过数据投毒和模型投毒两种策略实施。在有模型访问权限时,ToBAC 能让 Liquid 模型在 55% 的生成结果中因"cool"等普通词触发品牌推广或意识形态影响;无模型访问权限时,通过数据投毒对 JanusPro 的平均攻击成功率达 63.1%。该研究已被 NeurIPS 2026 接收。

来源:arXiv cs.AI · arxiv.org