SERL-SQL:Text-to-SQL智能体的选择性事后蒸馏强化学习框架
热点事件持续更新
SERL-SQL:Text-to-SQL智能体的选择性事后蒸馏强化学习框架
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Tao Liu 等作者提出 SERL-SQL,一个面向多轮 Text-to-SQL 智能体的选择性执行反馈强化学习框架。其做法是在训练期用教师模型结合执行反馈对学生动作重新打分,把教师与学生的似然差转化为有界掩码权重,只对 SQL 与工具动作的 token 重新加权 GRPO 优势。 该框架目前以论文形式发布,作者称其为“选择性、基于执行反馈的强化学习框架”,尚未见其在实际任务上的效果结论。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 12:00
SERL-SQL:面向 Text-to-SQL 强化智能体学习的选择性事后蒸馏框架报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.CLSERL-SQL:面向 Text-to-SQL 强化智能体学习的选择性事后蒸馏框架
SERL-SQL 是一个面向多轮 Text-to-SQL 智能体的选择性执行反馈强化学习框架,通过训练期教师模型结合执行反馈重打分学生动作,将教师-学生似然差转化为有界掩码权重,仅对 SQL 与工具动作 token 重加权 GRPO 优势。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。