arXiv cs.LG· Sanjit Dandapanthula, Shuvom Sadhuka, Samir Khan, Michael Oberst, Aaditya Ramdas, Alexandra Chouldechova·· 3 小时前AI 评分22
如何在代理模型上做后训练:包络采样缓解奖励攻击
How to post-train on a surrogate: Envelope sampling mitigates reward hacking
AI 导读
针对 LLM 后训练中因代理奖励失准导致的奖励攻击问题,研究者提出包络采样(envelope sampling),在假设人类奖励与重校准奖励位于评判模型周围的 L² 球内时,最小化后训练模型遗憾的上界。该方法可通过拒绝采样或针对修改后奖励微调来实现,在临床笔记生成和受控谄媚任务上,基于包络样本的重校准缓解了奖励攻击,而基于基座模型样本的重校准则未能做到。
来源:arXiv cs.LG · arxiv.org