跳到正文
arXiv cs.LG· Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve·· 6 小时前AI 评分29

面向代码优化的强化学习:DMC-Optim 让执行时间可学习

Reinforcement Learning for Code Optimization

AI 导读

研究团队提出三阶段方法让执行时间变得可学习,构建了 DMC-Optim 优化测试集与校准沙盒,并将正确性与速度组合进 RL 环境、改造 GRPO 以适应稀疏带噪的计时执行场景。

来源:arXiv cs.LG · arxiv.org