arXiv cs.LG· Muhammad Ahmed Mohsin, Muhammad Umer, Emily Fox·· 6 小时前AI 评分24
CU-DPO:连续效用直接偏好优化框架,策略选择准确率提升至 68-78%
Continuous-Utility Direct Preference Optimization
AI 导读
CU-DPO 用连续分数替代二元偏好标签,将模型对齐到多种基于提示词的认知策略组合。在数学推理基准上,该方法将七个基座模型的策略选择准确率从 35-46% 提升至 68-78%,分布内数据集下游推理最高提升 6.6 分,并在代码生成与因果推理基准上取得一致增益。该框架已入选 EMNLP 2026。
来源:arXiv cs.LG · arxiv.org