跳到正文
arXiv cs.CL· Krithik Vishwanath, Haitong Lin, Anton Alyakin, Jin Vivian Lee, D. Brock Hewitt, Jie J. Yao, William Robert Small, Hammad A. Khan, Cordelia Orillac, Aakaash Varma, Brandon Ye, Daniel Alexander Alber, Gustavo Stolovitzky, Batia Wiesenfeld, Oded Nov, Wei Wu, Kang Zhang, Yindalon Aphinyanaphongs, Tim Requarth, Eric Karl Oermann, The International Digital Twin Consortium in Healthcare, Medicine·· 2 小时前精选AI 评分62

研究:临床医生使用语言模型的方式与模型评测方式存在偏差

Clinician use of language models diverges from how the models are evaluated

AI 导读

一项研究分析了 6342 名医生、高级执业护士和护士在八个月内部署期间向机构助手发送的 127833 条查询,发现文档与行政类占 36.2%、知识检索占 28.9%,诊断仅占 3.7%,超过三分之一的查询按原样无法得到良好回答。

推荐理由

通过 12.7 万条真实临床提问与 58 个公开基准的对照,揭示评测任务分布与临床实际使用之间的差距。

来源:arXiv cs.CL · arxiv.org