Google a lancé EmbeddingGemma 2, un modèle d'encodage multimodal open-source qui unifie le code, les images, la vidéo et l'audio dans un espace partagé. Construit sur l'architecture Gemma 4 avec 740 millions de paramètres, il est conçu pour une inférence efficace sur appareil mobile sous une licence Apache 2.0 commercialement permissive.

  • Atteint des scores de pointe parmi les encodeurs multimodaux de moins d'1 milliard de paramètres sur les benchmarks MTEB Code et MAEB.
  • Une conception modulaire permet aux charges de travail uniquement textuelles de fonctionner avec aussi peu que 270M de paramètres, avec des encodeurs visuels et audio optionnels.
  • Utilise l'apprentissage de représentation Matryoshka pour tronquer les vecteurs de 768 à 128 dimensions, réduisant le stockage jusqu'à 6x.
  • Nécessite aussi peu que ~191 Mo de RAM active pour les poids uniquement textuels sur un Google Pixel 11 Pro.
  • Dispose d'une fenêtre de contexte de 8K tokens, quatre fois plus grande que la version précédente.

Le modèle permet une recherche sémantique robuste et un retour d'information entièrement sur du matériel edge, garantissant la confidentialité des données et réduisant la latence du pipeline. Lorsqu'il est associé à des modèles génératifs comme Gemma 4, il facilite les pipelines RAG sur appareil qui traitent des données multimodales complexes hors ligne.