Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、代码、图像、视频和音频映射到统一嵌入空间。模型权重已在 Hugging Face 和 Kaggle 上线,设备端优化版本可在 LiteRT Community on Hugging Face 下载,Gemini Enterprise Agent Platform Model Garden 的支持即将推出。 该模型面向端侧推理,文本任务可用 270M 参数版本,视觉和音频编码器分别为 170M 和 300M;Google 称量化后在 Pixel 11 Pro 上文本权重占用约 191MB 内存,完整多模态模型约 567MB,并可通过 Matryoshka 表示学习将输出向量从 768 维截断至 512、256 或 128 维。Google 称其在多模态嵌入基准上超过参数量两倍的竞品,在 Massive Text Embedding Benchmark(Code)上得分 …
最新进展EmbeddingGemma 2 发布:740M 参数多模态嵌入模型,支持本地推理