跳到正文
arXiv cs.AI· Jingnan Zheng, Dongcheng Zhang, Yi Zhang, Ming Zhang, Qiaosheng Zhang, Youbang Sun, An Zhang, Xiangnan He, Tat-Seng Chua, Xia Hu, Bowen Zhou, Chaochao Lu, Xiang Wang·· 3 小时前AI 评分42

ReSI:面向抗攻击与韧性 AI 的递归安全改进框架

ReSI: Recursive Safety Improvement toward Resistant and Resilient AI

AI 导读

研究者提出递归安全改进框架 ReSI,通过自动化研究循环对模型进行多轮红队测试、训练配方开发与安全更新,在四款稠密与 MoE 模型上将 X-Teaming 平均攻击成功率从 86.01% 降至 31.45%,低于 GPT-5.6-Luna 的 56.69%。ReSI 在分布内与分布外安全基准上追平或超越所评估的前沿模型,并在几乎全部安全评测中优于对齐基线,同时基本保留通用能力。

来源:arXiv cs.AI · arxiv.org