arXiv cs.CL· Shivani Kumar, Adarsh Bharathwaj, David Jurgens·· 9 小时前AI 评分32
行为经济学博弈可预测多智能体 LLM 团队在 AI for Science 任务中的表现
Cooperative Profiles Predict Multi-Agent LLM Team Performance in AI for Science Workflows
AI 导读
研究对 41 个开源权重 LLM 进行六种行为经济学博弈测试,发现博弈中表现出的合作倾向能稳健预测其在 AI for Science 任务中的团队表现。在共享 GPU 或额度约束下,善于协调并投入乘法式团队生产的模型,在科学报告的准确性、质量和完整性三项指标上均更优。该框架可在多智能体部署前快速筛查模型的合作适配度。
来源:arXiv cs.CL · arxiv.org