arXiv cs.CV· Yudong Han, Yong Wang, Zaiquan Yang, Liang Lin, Chongyang Tao, Xiangxiang Chu, Liyuan Pan·· 3 小时前AI 评分22
DyCPO:面向视频推理的自诊断多角色 Token 优化框架
Beyond Entropy: Self-Diagnostic Multi-Role Token Optimization for Video Reasoning
AI 导读
针对多模态强化学习中 token 级信用分配模糊的问题,研究者提出 DyCPO 协同演化框架,联合优化可靠 token 选择与自适应反事实干预。该方法构建多角色依赖度量,在 token 级对比学习中平衡视觉探索与答案相关性挖掘,并从模型自身成功与失败的 rollout 中动态导出反事实信号,实现自诊断分析与策略协同演化。在复杂视频推理和通用视频理解基准上,DyCPO 取得一致的性能提升。
来源:arXiv cs.CV · arxiv.org