arXiv cs.CL· Baowen Zhang, Wei Fan, Ruman Wang, Hangting Ye·· 5 小时前AI 评分22
LLM 在不完美表格上的问答错误研究:错误发现与处理机制
Understanding Errors in LLM-Based Question Answering over Imperfect Tables
AI 导读
研究基于 RADAR-T 的人类审核样本,对三种 LLM 进行受控实验,发现改变表格行顺序会改变错误发现结果,且仅提供已验证的错误位置不足以实现准确问答——在代码执行下,修复表格的准确率比错误标记表格高出 39.0-59.1 个百分点。为此提出 GBDI 工作流,在 RADAR-T 上对五种 LLM 的问答准确率较代码智能体基线提升 3.8-18.5 个百分点,代价是额外推理开销。
来源:arXiv cs.CL · arxiv.org