Google DeepMind a publié EmbeddingGemma 2, un modèle d'embedding multimodal open-source basé sur l'architecture Gemma 4 qui intègre du texte, du code, des images, des vidéos et de l'audio dans un espace vectoriel partagé de 768 dimensions. Le modèle compte 740 millions de paramètres avec une conception modulaire permettant des variantes plus petites pour le texte seul ou la vision-audio, et il prend en charge une fenêtre de contexte de 8K tokens.

  • EmbeddingGemma 2 atteint des scores de pointe parmi les embedding multimodaux sous 1 MdS, notamment 78,68 sur MTEB Code v1 et 49,39 sur MAEB (audio).
  • Le modèle est optimisé pour le déploiement sur appareil, nécessitant environ 191 Mo de RAM pour les poids du texte seul et 567 Mo pour le modèle multimodal complet sur un Pixel 11 Pro.
  • Il utilise l'apprentissage par représentation Matryoshka pour permettre la troncature des vecteurs à 512, 256 ou 128 dimensions, réduisant considérablement les besoins de stockage avec une perte de performance minimale.
  • Les poids sont disponibles sous licence Apache 2.0 sur Hugging Face et Kaggle, avec le support d'Ollama, llama.cpp, LiteRT et d'autres frameworks.

Cette publication permet la génération augmentée par récupération (RAG) respectueuse de la vie privée et des capacités de recherche locale en permettant aux développeurs d'exécuter les embeddings directement sur les appareils sans envoyer de données vers le cloud.