arXiv cs.LG· Yiming Xu, Hongyue Yu, Beihua Yang, Zihan Chen, Yixin Liu, Zhen Peng, Bin Shi, Bo Dong, Chao Shen, Irwin King, Qinghua Zheng·· 5 小时前AI 评分33
DecepEval:评估 LLM 智能体欺骗行为的基准
DecepEval: A Benchmark for Evaluating Deception in LLM Agents
AI 导读
研究者推出 DecepEval 基准,包含 3 类任务家族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类外部条件,并通过中性版与诱导版配对测量欺骗率变化。
来源:arXiv cs.LG · arxiv.org