Google DeepMind 发布了 EmbeddingGemma 2,这是一个基于 Gemma 4 架构构建的开源多模态嵌入模型,可将文本、代码、图像、视频和音频嵌入到共享的 768 维向量空间中。该模型拥有 7.4 亿个参数,采用模块化设计,支持更小的纯文本或视觉-音频变体,并支持 8K token 上下文窗口。
- EmbeddingGemma 2 在小于 1B 参数的多模态嵌入器中取得了领先的分数,包括 MTEB Code v1 上的 78.68 分和 MAEB (audio) 上的 49.39 分。
- 该模型针对设备端部署进行了优化,在 Pixel 11 Pro 上,纯文本权重仅需约 191MB RAM,完整多模态模型需要 567MB RAM。
- 它利用 Matryoshka Representation Learning 允许将向量截断为 512、256 或 128 维,在性能损失最小的情况下显著降低存储需求。
- 权重以 Apache 2.0 许可证在 Hugging Face 和 Kaggle 上提供,支持 Ollama、llama.cpp、LiteRT 和其他框架。
该发布使得隐私优先的检索增强生成 (RAG) 和本地搜索能力成为可能,允许开发者直接在设备上运行嵌入而无需将数据发送到云端。