arXiv cs.AI· Soumya Nasipuri, Sayak Ray Chowdhury, Sanjukta Roy·· 10 小时前AI 评分22
对齐中线性奖励的公理可满足性:用最小松弛量满足 PO 与 PMC
Axiom Satisfiability of Linear Rewards in Alignment
AI 导读
针对线性奖励拟合人类偏好时无法满足 PO 与 PMC 公理的问题,研究者将线性模型放宽为允许每个候选者带有松弛量,求出满足公理且总松弛量最小的松弛线性奖励。当候选数 m 且 margin η 不超过 O(1/m²) 时,最优总松弛量上界为 O(1),并给出紧实例。新方法对每次比较错误的线性部分计费,同时最小化总松弛量与违规数,实验显示其线性奖励优于线性 BTL。
来源:arXiv cs.AI · arxiv.org