跳到正文
arXiv cs.CL· Shuqing Shi, Ziyan Wang, Milind Tambe, Yali Du·· 8 小时前AI 评分22

HARP:通过显式偏好推断实现异构偏好下的 LLM 编排

Large Language Model Orchestration under Heterogeneous Preferences via Explicit Persona Inference

AI 导读

针对现有 LLM 编排器将智能体偏好信念存于提示词、缺乏显式更新规则导致早期错误持续传播的问题,研究者提出 HARP 框架,为每个智能体在有限候选偏好集上维护数值后验并用贝叶斯规则闭式更新,语言模型仅提供动作与各候选似然。HARP 被证明可达到与显式联合推断相同的 Õ(√K) 贝叶斯遗憾,其增强版 HARP⁺ 通过为区分候选的动作加奖励,在最优动作无信息时仍能持续推断。

来源:arXiv cs.CL · arxiv.org