跳到正文
arXiv cs.CL· Jin Huang, Diego Ferreras Garrucho, Yutong Xie, Walter M. Yuan, Qiaozhu Mei, Chen Lian, Jonathon Hazell·· 9 小时前AI 评分27

HouseholdBench:评估大语言模型预测家庭经济行为的能力

HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior

AI 导读

研究者推出 HouseholdBench,整合 6 项美国家庭调查与 32 个预测任务,覆盖消费、收入、劳动、预期和住房等数值、分类及概率结果,用于测试 LLM 能否预测家庭行为及其对政策变化的调整。13 个闭源与开源权重 LLM 参与评测,最佳模型将数值结果误差降低 12.2%,多数任务中梯度提升树排名第一。通过微调并聚合 16 次预测,40 亿参数开源模型可达到闭源模型水平。

来源:arXiv cs.CL · arxiv.org