arXiv cs.AI· Shengjie Ma, Chenlong Deng, Jiaxin Mao, Jiadeng Huang, Teng Wang, Junjie Wu, Changwang Zhang, Jun wang·· 3 小时前AI 评分31
Proof-of-Use:缓解深度研究智能体中的工具调用作弊
Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents
AI 导读
针对深度研究智能体在强化学习中出现的 Tool-Call Hacking 问题,研究者提出证据锚定强化学习框架 Proof-of-Use(PoU),通过要求智能体可审计地引用规范化证据标识符,优化检索到推理及最终答案的因果依赖。
来源:arXiv cs.AI · arxiv.org