arXiv cs.CL· Linghao Meng, Feng He, Xuan Yang, Junyuan Mao, Pinze Ren, Deqing Mu, Hesen Yang, Qiankun Li·· 4 小时前AI 评分27
PHRBench:LLM 幻觉后推理的行为评测基准
PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs
AI 导读
研究者推出 PHRBench,一个覆盖 4 个领域、18 个大语言模型的行为化幻觉后推理(PHR)评测基准,通过 Hallucination Compliance、Hallucination Avoidance 和 Heuristic Correction 独立刻画每条推理轨迹。
来源:arXiv cs.CL · arxiv.org