arXiv cs.AI· Arip Asadulaev, Aladin Djuhera, Karim Salta, Holger Boche, Fakhri Karray, Martin Takac·· 1 天前AI 评分27
热带强化学习:TROPIC 用热带半环替换概率求和提升 LLM 组合推理
Tropical Reinforcement Learning
AI 导读
针对大语言模型强化学习通常最大化期望回报、概率求和无法指出哪条解法真正有效的问题,研究者提出 Tropical Reinforcement Learning,用取最大值的热带半环替代概率相加,使状态价值对应最可能被验证解法的对数概率并附带可复用路径。
来源:arXiv cs.AI · arxiv.org