arXiv cs.AI· Luman Zhao, Minghui Xu, Yue Zhang, Yijun Yang·· 3 小时前AI 评分30
LTBD:用于提示词注入防御的可学习信任边界分隔符
LTBD: Learnable Trust-Boundary Delimiters for Prompt Injection Defense
AI 导读
研究者提出可学习信任边界分隔符 LTBD,通过在输入中显式编码信任边界来防御提示词注入,且不改变 LLM 参数。LTBD 在 AlpacaFarm 上实现 0.00% ASR,在 TaskTracker 上 ASR 仅 0.11-0.19%,性能优于推理时防御并与训练类方法相当,同时在自适应攻击下仍保持有效,推理开销可忽略。
来源:arXiv cs.AI · arxiv.org