arXiv cs.CV· Yifang Xu, Yunzhuo Sun, Benxiang Zhai, Ming Li, Wenxin Liang, Yang Li, Sidan Du·· 4 小时前AI 评分22
Moment-GPT:基于现成多模态大语言模型的零样本视频时刻检索
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
AI 导读
研究者提出 Moment-GPT,一个无需微调、基于冻结 MLLM 的零样本视频时刻检索(VMR)流程。该方法先用 LLaMA-3 纠正并改写查询以缓解语言偏差,再结合 MiniGPT-v2 自适应生成候选片段,最后由 VideoChatGPT 与 span scorer 选出最佳片段。
来源:arXiv cs.CV · arxiv.org