跳到正文
热点事件持续更新

SERL-SQL:Text-to-SQL智能体的选择性事后蒸馏强化学习框架

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Tao Liu 等作者提出 SERL-SQL,一个面向多轮 Text-to-SQL 智能体的选择性执行反馈强化学习框架。其做法是在训练期用教师模型结合执行反馈对学生动作重新打分,把教师与学生的似然差转化为有界掩码权重,只对 SQL 与工具动作的 token 重新加权 GRPO 优势。 该框架目前以论文形式发布,作者称其为“选择性、基于执行反馈的强化学习框架”,尚未见其在实际任务上的效果结论。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CL
    SERL-SQL:面向 Text-to-SQL 强化智能体学习的选择性事后蒸馏框架

    SERL-SQL 是一个面向多轮 Text-to-SQL 智能体的选择性执行反馈强化学习框架,通过训练期教师模型结合执行反馈重打分学生动作,将教师-学生似然差转化为有界掩码权重,仅对 SQL 与工具动作 token 重加权 GRPO 优势。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。