跳到正文
arXiv cs.CV· Yifang Xu, Yunzhuo Sun, Benxiang Zhai, Ming Li, Wenxin Liang, Yang Li, Sidan Du·· 4 小时前AI 评分22

Moment-GPT:基于现成多模态大语言模型的零样本视频时刻检索

Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models

AI 导读

研究者提出 Moment-GPT,一个无需微调、基于冻结 MLLM 的零样本视频时刻检索(VMR)流程。该方法先用 LLaMA-3 纠正并改写查询以缓解语言偏差,再结合 MiniGPT-v2 自适应生成候选片段,最后由 VideoChatGPT 与 span scorer 选出最佳片段。

来源:arXiv cs.CV · arxiv.org