O Google DeepMind lançou o EmbeddingGemma 2, um modelo de embedding multimodal de código aberto construído na arquitetura Gemma 4 que incorpora texto, código, imagens, vídeo e áudio em um espaço vetorial compartilhado de 768 dimensões. O modelo possui 740 milhões de parâmetros com um design modular que permite variantes menores apenas para texto ou para visão-áudio, e suporta uma janela de contexto de 8K tokens.
- EmbeddingGemma 2 alcança pontuações líderes entre incorporadores multimodais com menos de 1B de parâmetros, incluindo 78.68 no MTEB Code v1 e 49.39 no MAEB (áudio).
- O modelo é otimizado para implantação em dispositivos, exigindo aproximadamente 191MB de RAM para pesos apenas de texto e 567MB para o modelo multimodal completo em um Pixel 11 Pro.
- Ele utiliza Aprendizado de Representação Matryoshka para permitir a truncagem do vetor para 512, 256 ou 128 dimensões, reduzindo significativamente os requisitos de armazenamento com perda mínima de desempenho.
- Os pesos estão disponíveis sob uma licença Apache 2.0 no Hugging Face e Kaggle, com suporte para Ollama, llama.cpp, LiteRT e outros frameworks.
O lançamento permite geração aumentada por recuperação (RAG) focada na privacidade e capacidades de busca local, permitindo que desenvolvedores executem embeddings diretamente nos dispositivos sem enviar dados para a nuvem.