跳到正文
arXiv cs.AI· Wenwen Si, Honghao Wei·· 12 小时前AI 评分17

基于共形动作集的强化学习:在序列推荐中的应用

Reinforcement Learning with Conformal Action Sets: An Application to Sequential Recommendation

AI 导读

研究者提出 Calibrated Pruning 强化学习(RLCP),利用 critic 分数和在线阈值自适应调整保留动作集,并证明自适应轨迹上代理漏检率的确定性上界。在 KuaiRand-Pure 和 MovieLens 1M 上对比四种 RL 基线,19 种配置中至少一个 RLCP 变体取得最高目录多样性,达最强基线的 1.11× 至 5.21×,会话深度相当且保留集不更大。

来源:arXiv cs.AI · arxiv.org