arXiv cs.AI· Yang Qu, Yusheng Han, Chengjia Feng, Handan Liu·· 12 小时前AI 评分18
LSC-DPO:学习信号受控的直接偏好优化
LSC-DPO: Learning-Signal-Controlled Direct Preference Optimization
AI 导读
研究提出 LSC-DPO,从损失几何视角将 DPO 损失中的 sigmoid 因子视为刻画目标局部敏感度的学习信号,并动态将其调节至目标区间。在 AlpacaEval 2、MT-Bench 和 Anthropic-HH 上,LSC-DPO 持续优于 DPO 及强偏好优化基线。研究还发现不同系数初始化会产生不同的瞬态学习信号轨迹,据此推导出信号预算补偿规则,显著降低跨初始化的性能波动。
来源:arXiv cs.AI · arxiv.org