Google DeepMind は、テキスト、コード、画像、動画、音声を統一された 768 次元のベクトル空間にマッピングするオープンソースのマルチモーダル埋め込みモデルである EmbeddingGemma 2 をリリースしました。このモデルは合計 7.4 億パラメータで構成され、2.7 億パラメータのテキストエンコーダとモジュール式のビジョン(1.7 億)およびオーディオ(3 億)エンコーダを組み合わせています。
- 低遅延のセマンティック表現を実現するため、モバイルデバイスやノートパソコンなどの消費者向けハードウェアで実行するように設計されています。
- 検索、検索拡張生成 (RAG)、分類、クラスタリングを含むオンデバイスアプリケーションをサポートします。
- Hugging Face を介してオープンモデルとして利用可能です。