Google DeepMind は、テキスト、コード、画像、動画、音声を統一された 768 次元のベクトル空間にマッピングするオープンソースのマルチモーダル埋め込みモデルである EmbeddingGemma 2 をリリースしました。このモデルは合計 7.4 億パラメータで構成され、2.7 億パラメータのテキストエンコーダとモジュール式のビジョン(1.7 億)およびオーディオ(3 億)エンコーダを組み合わせています。

  • 低遅延のセマンティック表現を実現するため、モバイルデバイスやノートパソコンなどの消費者向けハードウェアで実行するように設計されています。
  • 検索、検索拡張生成 (RAG)、分類、クラスタリングを含むオンデバイスアプリケーションをサポートします。
  • Hugging Face を介してオープンモデルとして利用可能です。