跳到正文
热点事件持续更新

研究团队发布多轮不可回答性基准与评估工具

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

研究团队发布了一个轮次标注的多轮不可回答性基准和配套评估工具,用于测试大语言模型识别“问题无法回答”的能力能否跨数据集、跨轮次迁移。基准包含 423 段对话、1,661 个标注轮次状态,评估框架配有可回答澄清问题的模拟用户。 团队用 6 个数据集和 6 个开源权重模型测试不可回答性探针的迁移能力,结果显示检测与利用之间存在差距。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    LLM 不可回答性信号能否跨域与多轮泛化?新基准与评估框架揭示检测与利用之间的差距

    研究团队构建了一个轮次标注的多轮基准(423 段对话、1,661 个标注轮次状态)和带模拟用户的评估框架,用 6 个数据集与 6 个开源权重 LLM 测试不可回答性探针的迁移能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。