arXiv cs.LG· Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia·· 10 小时前AI 评分24
TOPL:面向分布偏移下忠实生成的 Token 级离策略学习
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
AI 导读
研究者提出 Token 级离策略标注(TOPL),将后训练重构为 token 级正确性预测任务,通过让模型区分回复中的好 token 与坏 token 来引导生成。
来源:arXiv cs.LG · arxiv.org