arXiv cs.LG· Yue Zhao, Xiyang Hu, Zuobin Xiong, Zhangyu Wang, Ruolin Li·· 3 小时前AI 评分31
AI4Fire:大语言模型在野火任务上的评测
AI4Fire: Evaluating Large Language Models on Wildfire Tasks
AI 导读
AI4Fire 对 6 个核心模型在 5 项野火任务上做了零样本评测,并对比"裸跑"与"接地"两种设置,另扩展 29 个模型。接地在补充信息直接含答案时收益最大:只读 SQL 工具让所有核心模型的数据库准确率从最高 16% 提升到至少 88%。但简单规则难以被超越,没有核心模型胜过直接沿用当日人力数量,且公开数据存在隐患,如一个火险列可完美区分留出集。
来源:arXiv cs.LG · arxiv.org