arXiv cs.AI· Aniruddh Pramod, James Oldfield, Adel Bibi·· 10 小时前AI 评分27
面向统一滥用监控基准的研究
Towards a Unified Misuse Monitoring Benchmark
AI 导读
研究者提出统一的 trace 级滥用监控形式化方法,并构建约 6,200 条用户、LLM agent 与环境对话记录的基准,覆盖分解攻击与提示注入攻击两类威胁,标注 harm window 并配良性对照与拒绝实例。
来源:arXiv cs.AI · arxiv.org