arXiv cs.LG· Rabimba Karanjai, Qun Gu, Hemanth Hegadehalli Madhavarao, Wenhuan Sun, Xiaojiao Yu, Suryabhan Singh Hada, Libin N. George, Uma Kona, Richard Williamson, Linsey Pang, Prakhar Mehrotra·· 6 小时前AI 评分30
CM-DPO:面向 LLM 规划的约束边际直接偏好优化
CM-DPO: Constraint-Margin Direct Preference Optimization for LLM Planning
AI 导读
研究者提出 CM-DPO,用确定性符号验证器生成的连续边际替代 DPO 的二元偏好信号,并按违规严重程度缩放,通过词典序目标分离硬约束与软约束。配套 SynPlan-R 框架以 DCCG 程序化约束配置和 RT-MED 最小编辑蒸馏生成低偏差偏好数据。
来源:arXiv cs.LG · arxiv.org