Google DeepMind a publié EmbeddingGemma 2, un modèle d'embedding multimodal open source qui mappe le texte, le code, les images, la vidéo et l'audio dans un espace vectoriel unifié de 768 dimensions. Le modèle comprend 740 millions de paramètres au total, combinant un encodeur de texte de 270M de paramètres avec des encodeurs modulaires de vision (170M) et d'audio (300M).
- Conçu pour fonctionner sur du matériel grand public comme les appareils mobiles et les ordinateurs portables pour des représentations sémantiques à faible latence.
- Prend en charge les applications sur l'appareil, y compris la recherche, la génération augmentée par récupération (RAG), la classification et le clustering.
- Disponible en tant que modèle ouvert via Hugging Face.