跳到正文
arXiv cs.CL· Shiliang Xiao·· 4 小时前AI 评分10

TACS:面向 LLM 越狱后缀优化的轨迹感知候选选择框架(已被作者撤稿)

TACS: Trajectory-Aware Candidate Selection for LLM Jailbreak Suffix Optimization

AI 导读

论文 TACS 提出一种轨迹感知的候选选择框架,用于 LLM 越狱后缀优化,通过引入轨迹感知代理、参考策略正则化和判别器估计的卡方修正,缓解候选选择阶段的奖励黑客问题。在 HarmBench 上,TACS 在相同搜索预算下持续优于强基线,显著提升攻击成功率。作者 Shiliang Xiao 因发现理论分析存在错误、影响主要结论有效性,已撤稿。

来源:arXiv cs.CL · arxiv.org