arXiv cs.AI· Jerzy Kami\'nski, Ilya Galyukshev, Artem Kuznetsov, Danil Fedorov, Kirill Redko, Sergey Chuprin, Aidar Shumbalov, Stanislav Chumakov, Anna Kalyuzhnaya·· 5 小时前AI 评分26
LLM 不可回答性信号能否跨域与多轮泛化?新基准与评估框架揭示检测与利用之间的差距
Knowing When Not to Answer: Cross-Domain and Multi-Turn Generalization of Latent Underspecification Signals
AI 导读
研究团队构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评估框架,用 6 个数据集与 6 个开源权重 LLM 测试不可回答性探针的迁移能力。
来源:arXiv cs.AI · arxiv.org