arXiv cs.CL· Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts·· 4 小时前AI 评分31
DocOpt:用强化学习优化文档以提升黑盒检索
Document Optimization for Black-Box Retrieval via Reinforcement Learning
AI 导读
研究者提出 DocOpt,用 GRPO 以检索排名提升为奖励训练 LLM 或 VLM 改写文档,仅需黑盒访问检索排名,适用于单向量、多向量和词法检索器。
来源:arXiv cs.CL · arxiv.org