跳到正文
热点事件持续更新

AI4Fire发布野火任务LLM评测基准

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

AI4Fire 对 6 个核心模型在 5 项野火任务上做了零样本评测,并对比“裸跑”与“接地”两种设置,另扩展 29 个模型。结果显示,接地在补充信息直接含答案时收益最大:只读 SQL 工具让所有核心模型的数据库准确率从最高 16% 提升到至少 88%。 但简单规则难以被超越,没有核心模型胜过直接沿用当日人力数量。公开数据也存在隐患,例如一个火险列可完美区分留出集。作者发布了提示词、回答、评分、代码及调查记录。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.LG
    AI4Fire:大语言模型在野火任务上的评测

    AI4Fire 对 6 个核心模型在 5 项野火任务上做了零样本评测,并对比"裸跑"与"接地"两种设置,另扩展 29 个模型。接地在补充信息直接含答案时收益最大:只读 SQL 工具让所有核心模型的数据库准确率从最高 16% 提升到至少 88%。但简单规则难以被超越,没有核心模型胜过直接沿用当日人力数量,且公开数据存在隐患,如一个火险列可完美区分留出集。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。