Google DeepMindは、Gemma 4アーキテクチャに基づいて構築され、テキスト、コード、画像、動画、オーディオを共有の768次元ベクトル空間に埋め込むオープンソースのマルチモーダル埋め込みモデルであるEmbeddingGemma 2をリリースした。本モデルは7億4000万パラメータを持ち、より小さなテキスト専用やビジョン・オーディオのバリアントを可能にするモジュラー設計を採用しており、8Kトークンのコンテキストウィンドウをサポートする。

  • EmbeddingGemma 2は、MTEB Code v1で78.68、MAEB (audio)で49.39などのスコアを記録し、10億未満のパラメータ数を持つマルチモーダル埋め込みモデルの中でトップクラスの性能を示している。
  • 本モデルはオンデバイス展開向けに最適化されており、Pixel 11 Pro上でテキスト専用ウェイトの場合約191MB、フルマルチモーダルモデルの場合567MBのRAMを必要とする。
  • Matryoshka Representation Learningを活用し、ベクトルを512、256、または128次元に切り詰めることを可能にし、最小限のパフォーマンス低下でストレージ要件を大幅に削減する。
  • ウェイトはApache 2.0ライセンスの下でHugging FaceおよびKaggleで公開されており、Ollama、llama.cpp、LiteRT、その他のフレームワークをサポートする。

このリリースにより、開発者がデータをクラウドに送信せずにデバイス上で直接埋め込みを実行できるようになり、プライバシーを最優先とする検索強化生成(RAG)やローカル検索機能が実現可能となる。