跳到正文
arXiv cs.AI· Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang·· 13 小时前AI 评分33

Sherpa:让 LLM 学会自适应教学

Sherpa: Teaching LLMs to Teach Adaptively

AI 导读

多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其所教学生在所有原型上平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究显示,其训练出的教师模型在 79.6% 的成对比较中优于基座模型。

来源:arXiv cs.AI · arxiv.org