跳到正文
热点事件持续更新

TiTok音视频多段时序定位模型发布

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者 Eunji Shin 等人发布音视频大语言模型 TiTok,用于未剪辑视频的音视频多片段定位(AV-MSG):对每个查询,模型可定位任意数量的时序事件片段。 TiTok 引入 Time Token Interleaving(TTI)对齐输入侧的时序感知与输出侧的时序预测,并采用 GDPO 优化全局、局部、数量、精度、格式五类解耦奖励。该工作同时提出 AV-MSG 评测协议。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CV
    TiTok:面向多片段时序定位的音视频 LLM

    针对未剪辑视频的音视频多片段定位(AV-MSG),研究者提出音视频大语言模型 TiTok,可为每个查询定位任意数量的时序事件片段。TiTok 引入 Time Token Interleaving(TTI)对齐输入侧时序感知与输出侧时序预测,并用 GDPO 优化全局、局部、数量、精度、格式五类解耦奖励。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。