Google DeepMind ha lanzado EmbeddingGemma 2, un modelo de incrustación multimodal de código abierto que mapea texto, código, imágenes, video y audio en un espacio vectorial unificado de 768 dimensiones. El modelo consta de 740 millones de parámetros en total, combinando un codificador de texto de 270M de parámetros con codificadores modulares de visión (170M) y audio (300M).

  • Diseñado para ejecutarse en hardware de consumo como dispositivos móviles y portátiles para representaciones semánticas de baja latencia.
  • Admite aplicaciones en el dispositivo, incluyendo búsqueda, generación aumentada por recuperación (RAG), clasificación y agrupamiento.
  • Disponible como modelo abierto a través de Hugging Face.