研究幻觉检测基准中的标注标准错配问题
热点事件持续更新
研究幻觉检测基准中的标注标准错配问题
1 篇报道1 个报道来源4 小时前更新
先了解这件事
报道摘要
研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。
摘自 arXiv cs.CL
最新进展10月7日 12:00
幻觉检测基准中的标注问题:一项实证评估报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv cs.CL幻觉检测基准中的标注问题:一项实证评估
研究用 900 个人工标注的问答对,覆盖三个常用 QA 数据集和三个生成模型,评估了词汇相似度指标、基于参考蕴含的 NLI 基线及七个 LLM 评判器作为自动标注器的表现。实验发现自动标注策略之间及其与人工标注之间存在显著分歧,多数策略还表现出明显的方向性误差偏差。对多数评判器-生成器组合而言,将面向忠实性的提示词替换为面向事实正确性的提示词,能提升与人工标注的一致性并减少假阳性主导。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。