跳到正文
arXiv cs.AI· Jerzy Kami\'nski, Ilya Galyukshev, Artem Kuznetsov, Danil Fedorov, Kirill Redko, Sergey Chuprin, Aidar Shumbalov, Stanislav Chumakov, Anna Kalyuzhnaya·· 12 小时前AI 评分26

LLM 不可回答性信号能否跨域与多轮泛化?新基准与评估框架揭示检测与利用之间的差距

Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals

AI 导读

研究团队构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评估框架,用 6 个数据集与 6 个开源权重 LLM 测试不可回答性探针的迁移能力。

来源:arXiv cs.AI · arxiv.org