Google DeepMind ha lanzado EmbeddingGemma 2, un modelo de incrustación multimodal de código abierto basado en la arquitectura Gemma 4 que incrusta texto, código, imágenes, video y audio en un espacio vectorial compartido de 768 dimensiones. El modelo cuenta con 740 millones de parámetros y un diseño modular que permite variantes más pequeñas solo para texto o para visión-audio, y admite una ventana de contexto de 8K tokens.
- EmbeddingGemma 2 alcanza puntuaciones destacadas entre los incrustadores multimodales de menos de 1B, incluyendo 78.68 en MTEB Code v1 y 49.39 en MAEB (audio).
- El modelo está optimizado para la implementación en dispositivos, requiriendo aproximadamente 191MB de RAM para los pesos solo de texto y 567MB para el modelo multimodal completo en un Pixel 11 Pro.
- Utiliza Matryoshka Representation Learning para permitir la truncación de vectores a 512, 256 o 128 dimensiones, reduciendo significativamente los requisitos de almacenamiento con una pérdida mínima de rendimiento.
- Los pesos están disponibles bajo una licencia Apache 2.0 en Hugging Face y Kaggle, con soporte para Ollama, llama.cpp, LiteRT y otros frameworks.
El lanzamiento habilita la generación aumentada por recuperación (RAG) centrada en la privacidad y capacidades de búsqueda local al permitir que los desarrolladores ejecuten incrustaciones directamente en dispositivos sin enviar datos a la nube.