跳到正文
arXiv cs.CL· Jorma Valjakka, Juhani Kivim\"aki, Juha Myll\"ari, Jukka K. Nurminen·· 9 小时前AI 评分29

幻觉检测基准中的标注问题:一项实证评估

The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation

AI 导读

研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。

来源:arXiv cs.CL · arxiv.org