跳到正文
arXiv cs.AI· Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang·· 10 小时前AI 评分32

D-OPCD:通过在线策略上下文蒸馏将智能体经验内化进扩散模型权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI 导读

研究提出 Diffusion On-Policy Context Distillation(D-OPCD),将智能体改进后的提示词作为特权上下文,把智能体框架的能力蒸馏进扩散模型权重,使其仅凭原始查询也能保留部分框架收益。

来源:arXiv cs.AI · arxiv.org