O Google DeepMind lançou o EmbeddingGemma 2, um modelo de embedding multimodal de código aberto que mapeia texto, código, imagens, vídeo e áudio em um espaço vetorial unificado de 768 dimensões. O modelo consiste em 740 milhões de parámetros no total, combinando um codificador de texto de 270M de parámetros com codificadores modulares de visão (170M) e áudio (300M).

  • Projetado para rodar em hardware de consumo como dispositivos móveis e laptops para representações semânticas de baixa latência.
  • Suporta aplicativos no dispositivo, incluindo busca, geração aumentada por recuperação (RAG), classificação e agrupamento.
  • Disponível como modelo aberto via Hugging Face.