TiTok音视频多段时序定位模型发布
热点事件持续更新
TiTok音视频多段时序定位模型发布
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究者 Eunji Shin 等人发布音视频大语言模型 TiTok,用于未剪辑视频的音视频多片段定位(AV-MSG):对每个查询,模型可定位任意数量的时序事件片段。 TiTok 引入 Time Token Interleaving(TTI)对齐输入侧的时序感知与输出侧的时序预测,并采用 GDPO 优化全局、局部、数量、精度、格式五类解耦奖励。该工作同时提出 AV-MSG 评测协议。
AI 根据报道生成 · 3 小时前更新
最新进展10月8日 12:00
TiTok:面向多片段时序定位的音视频 LLM报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CVTiTok:面向多片段时序定位的音视频 LLM
针对未剪辑视频的音视频多片段定位(AV-MSG),研究者提出音视频大语言模型 TiTok,可为每个查询定位任意数量的时序事件片段。TiTok 引入 Time Token Interleaving(TTI)对齐输入侧时序感知与输出侧时序预测,并用 GDPO 优化全局、局部、数量、精度、格式五类解耦奖励。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。