O Google lançou o EmbeddingGemma 2, um modelo de embedding multimodal de código aberto que unifica código, imagens, vídeo e áudio em um espaço compartilhado. Construído na arquitetura Gemma 4 com 740 milhões de parâmetros, ele é projetado para inferência eficiente em dispositivos sob uma licença Apache 2.0 comercialmente permissiva.
- Alcança pontuações líderes entre embedders multimodais sub-1B nos benchmarks MTEB Code e MAEB.
- O design modular permite que cargas de trabalho apenas de texto sejam executadas com tão poucos quanto 270M parâmetros, com codificadores opcionais de visão e áudio.
- Usa Matryoshka Representation Learning para truncar vetores de 768 para 128 dimensões, proporcionando até uma redução de armazenamento de 6x.
- Requer tão pouco quanto ~191MB de RAM ativa para pesos apenas de texto em um Google Pixel 11 Pro.
- Apresenta uma janela de contexto de 8K tokens, quatro vezes maior que a versão anterior.
O modelo permite busca semântica robusta e recuperação inteiramente em hardware de borda, garantindo privacidade de dados e reduzindo a latência do pipeline. Ao ser combinado com modelos generativos como o Gemma 4, facilita pipelines de RAG no dispositivo que processam dados multimodais complexos offline.