arXiv cs.AI· Xueting Fang, Zehui Li, Yang Yang, Camilla Giovino, Shubh K. Patel, Shailly Prajapati, Vallijah Subasri, Caihua Shan·· 9 小时前AI 评分40
KlinikeBench:评估语言模型在临床问诊中的表现,而非仅看诊断准确率
KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy
AI 导读
KlinikeBench 是一个包含 333 个临床医生编写任务的基准,每个任务提供虚拟患者、临床工具和任务专属成功标准,超过 35 位临床医生参与编写与评估。
来源:arXiv cs.AI · arxiv.org