arXiv cs.CL· Isadora White, Yasaman Jafari, Taylor Berg-Kirkpatrick·· 3 小时前AI 评分36
对话式 LLM 智能体的黑盒取证研究
Black-Box Forensics for Conversational LLM Agents
AI 导读
研究对匿名端点背后的对话式 LLM 智能体开展黑盒取证,归因分类器仅凭几轮非对抗对话即可识别底层模型,准确率达 98%。系统提示词归因需针对每个提示词重新训练大量数据,成本高昂;跨编码器指纹方法在完全未见过的系统提示词上取得 AUC 0.768、F1 0.703,聚合每个目标智能体 50 段对话后 AUC 提升至 0.943。
来源:arXiv cs.CL · arxiv.org