跳到正文
arXiv cs.LG· Wenqi Li, Bin Liu, Mindi Ruan, Chuanbo Hu, Minglei Yin, Xin Li·· 6 小时前AI 评分22

Conditional Accuracy Profiles:跨部署条件诊断 LLM 评审模型

Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions

AI 导读

研究者提出 Conditional Accuracy Profiling(CAP)诊断框架,将 LLM-as-judge 的成对准确率拆解为内容敏感性、鲁棒性和理由质量三类共八种条件,并在七个 LLM 评审模型、六个成对评审基准上实例化。

来源:arXiv cs.LG · arxiv.org