跳到正文
arXiv cs.CV· Eunji Shin, Dahyun Choi, Seungyeon Jo, Yejin Hong, Jiyoung Lee·· 4 小时前AI 评分22

TiTok:面向多片段时序定位的音视频 LLM

TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding

AI 导读

针对未剪辑视频的音视频多片段定位(AV-MSG),研究者提出音视频大语言模型 TiTok,可为每个查询定位任意数量的时序事件片段。TiTok 引入 Time Token Interleaving(TTI)对齐输入侧时序感知与输出侧时序预测,并用 GDPO 优化全局、局部、数量、精度、格式五类解耦奖励。

来源:arXiv cs.CV · arxiv.org