跳到正文
arXiv cs.CL· Linghao Meng, Feng He, Xuan Yang, Junyuan Mao, Pinze Ren, Deqing Mu, Hesen Yang, Qiankun Li·· 4 小时前AI 评分27

PHRBench:LLM 幻觉后推理的行为评测基准

PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

AI 导读

研究者推出 PHRBench,一个覆盖 4 个领域、18 个大语言模型的行为化幻觉后推理(PHR)评测基准,通过 Hallucination Compliance、Hallucination Avoidance 和 Heuristic Correction 独立刻画每条推理轨迹。

来源:arXiv cs.CL · arxiv.org