Google DeepMind 发布了 EmbeddingGemma 2,这是一个开源的多模态嵌入模型,可将文本、代码、图像、视频和音频映射到统一的 768 维向量空间中。该模型共有 7.4 亿个参数,由一个 2.7 亿参数的文本编码器与模块化的视觉(1.7 亿)和音频(3 亿)编码器组合而成。
- 旨在在消费级硬件(如移动设备和笔记本电脑)上运行,以实现低延迟的语义表示。
- 支持设备端应用,包括搜索、检索增强生成 (RAG)、分类和聚类。
- 可通过 Hugging Face 作为开源模型获取。
Google DeepMind 发布了 EmbeddingGemma 2,这是一个开源的多模态嵌入模型,可将文本、代码、图像、视频和音频映射到统一的 768 维向量空间中。该模型共有 7.4 亿个参数,由一个 2.7 亿参数的文本编码器与模块化的视觉(1.7 亿)和音频(3 亿)编码器组合而成。