跳到正文
arXiv cs.CL· Jin Huang, Yutong Xie, Wanli Song, Xingjian Zhang, Walter Yuan, Matthew O. Jackson, Qiaozhu Mei·· 4 小时前AI 评分24

BehaviorBench:面向行为科学任务的基础模型基准测试

BehaviorBench: Benchmarking Foundation Models for Behavioral Science Tasks

AI 导读

研究者推出 BehaviorBench,从行为预测与模拟、策略决策、主体特质推断、行为知识应用四项能力评估基础模型,并在个体与分布两个层面衡量表现。结果显示该基准对领先的通用 LLM 和用行为数据专门训练的行为基础模型仍具挑战性:通用 LLM 倾向低估人类回答的多样性,行为基础模型则在个体层面预测上落后。用多样行为数据微调可同时提升个体预测与分布对齐。

来源:arXiv cs.CL · arxiv.org