跳到正文
热点事件持续更新

原生多模态预训练缩放规律研究

1 篇报道1 个报道来源2 小时前更新

先了解这件事

报道摘要

一项 arXiv 研究在固定算力预算下考察了 Transformer 视觉语言模型的最优模型规模与 token 数量,发现最小目标损失遵循可预测的算力定律,而算力最优的模型规模与 token 数呈幂律缩放。

摘自 arXiv cs.CV

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CV
    从零开始的原生多模态预训练缩放规律研究

    一项 arXiv 研究在固定算力预算下考察了 Transformer 视觉语言模型的最优模型规模与 token 数量,发现最小目标损失遵循可预测的算力定律,而算力最优的模型规模与 token 数呈幂律缩放。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。