arXiv cs.CL· M. Mikail Demir, M. Abdullah Canbaz·· 3 小时前AI 评分27
PARCEL:面向法律幻觉检测的声明级基准
When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection
AI 导读
研究者推出 PARCEL 基准,用于检测法律声明是否被所引权威来源支持,数据集基于纽约州上诉法院近期判决,包含 3,396 条括注式声明,标注为 Supported、Refuted 或 Not Found。在零样本设置下评测多个 SOTA LLM,最强模型准确率达 0.97,但仍会把无支撑声明误判为有支撑,即使提供完整判决书文本。缺失支撑比直接矛盾更难识别,伪造但看似合理的引注导致性能下降最大。
来源:arXiv cs.CL · arxiv.org