QuadTok四叉树视觉分词器论文发布
热点事件持续更新
QuadTok四叉树视觉分词器论文发布
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Yucheng Mao 等作者发布论文,提出四叉树结构的视觉分词器 QuadTok,为图像复杂区域动态分配更多表征容量,用于自回归图像生成。论文称,在 ImageNet 上它比固定 256-token 网格节省约 10% token,零样本迁移到 COCO 节省 9%,重建保真度相当。 其 947M GPT 风格生成模型在 ImageNet 256×256 上取得 2.08 gFID,并支持零样本空间可控图像生成。上述节省与生成效果均为论文报告的结果。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
QuadTok:用于自回归图像生成的四叉树视觉分词器报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.CVQuadTok:用于自回归图像生成的四叉树视觉分词器
QuadTok 提出一种四叉树结构的视觉分词器,动态为复杂区域分配更多表征容量,在 ImageNet 上比固定 256-token 网格节省约 10% token,零样本迁移到 COCO 节省 9%,重建保真度相当。其 947M GPT 风格生成模型在 ImageNet 256×256 上取得 2.08 gFID,并支持零样本空间可控图像生成。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。