跳到正文
arXiv cs.LG· Marsalis Gibson, Claire Tomlin, Shankar Sastry·· 10 小时前AI 评分22

ATLAS:面向潜在对抗搜索的自适应信赖域与主动学习框架

ATLAS-AL: Adaptive Trust-Region for Latent Adversarial Searches via Active Learning

AI 导读

ATLAS 是一个基于查询的黑盒对抗攻击框架,将攻击生成建模为主动学习的水平集估计问题,结合校准近似与局部-全局采样架构定位对抗区域。在 MNIST、CIFAR 和 ImageNet 上,ATLAS 生成的对抗样本比 NES、SignHunter、BayesOpt 等查询式黑盒攻击更具代表性,并能在有限查询预算下覆盖更多对抗区域。该框架可用于自动化红队测试,支持开发中的鲁棒性分析与持续审计。

来源:arXiv cs.LG · arxiv.org