跳到正文
arXiv cs.CL· William Philipp, Finn Fassbender, Daniel Fister, Thorsten Langer, Martje G. Pauly, Rebecca Herzog, Markus A. Hobert, Theresa Paulus, Alexander Baumann, Chi Wang Ip, Lukas L. Goede, Johanna Reimer, Sebastian L\"ons, Ronald B\"ock, Sebastian Fudickar·· 9 小时前AI 评分22

德国开放问答临床基准 MedQADE 发布:LLM 评审与医生标注一致性及偏见研究

Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention

AI 导读

研究者发布德语开放问答临床基准 MedQADE,含 3,800 组问答、10 位医生标注和 9 个 LLM 评审。医生对答案正确性一致性中等偏强(Cohen's kappa = 0.612),Gemini 3 Flash 接近留一医生参考(kappa = 0.694 vs 0.709)。

来源:arXiv cs.CL · arxiv.org