跳到正文
arXiv cs.AI· Xueting Fang, Zehui Li, Yang Yang, Camilla Giovino, Shubh K. Patel, Shailly Prajapati, Vallijah Subasri, Caihua Shan·· 9 小时前AI 评分40

KlinikeBench:评估语言模型在临床问诊中的表现,而非仅看诊断准确率

KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

AI 导读

KlinikeBench 是一个包含 333 个临床医生编写任务的基准,每个任务提供虚拟患者、临床工具和任务专属成功标准,超过 35 位临床医生参与编写与评估。

来源:arXiv cs.AI · arxiv.org