arXiv cs.AI· Suxin Ji, Hungtao Wan, Shaoxuan Chen, An Zhang·· 5 小时前AI 评分31
语义行为水印 SBW:为 LLM 智能体提供抗改写、抗伪造的来源溯源
Semantic Behavioral Watermarking: Paraphrase-Robust and Forgery-Resistant Provenance for LLM Agents
AI 导读
研究者提出语义行为水印(SBW),在历史条件下的语义动作簇上嵌入水印,并用密钥化抗碰撞分桶替代公开簇分桶,使伪造轨迹无法通过验证。在 ToolBench(每模型 600 条轨迹)上,改写场景下簇级检测率为 0.49-0.66,而精确符号方案仅 0.05-0.17;ALFWorld(每模型 100 集)上为 0.92-0.97 对 0.00-0.01。
来源:arXiv cs.AI · arxiv.org