Google DeepMind выпустила EmbeddingGemma 2, модель мультимодального встраивания с открытым исходным кодом, построенную на архитектуре Gemma 4, которая преобразует текст, код, изображения, видео и аудио в общее векторное пространство размерности 768. Модель имеет 740 миллионов параметров и модульную конструкцию, позволяющую создавать более компактные версии только для текста или для зрения и аудио, а также поддерживает контекстное окно на 8 тысяч токенов.

  • EmbeddingGemma 2 демонстрирует ведущие результаты среди мультимодальных моделей встраивания с количеством параметров менее 1 миллиарда, включая 78.68 на MTEB Code v1 и 49.39 на MAEB (аудио).
  • Модель оптимизирована для развертывания на устройствах: для весов только текстовой версии требуется около 191 МБ оперативной памяти, а для полной мультимодальной модели — 567 МБ на устройстве Pixel 11 Pro.
  • В ней используется обучение матрешечным представлениям (Matryoshka Representation Learning), что позволяет обрезать векторы до размерностей 512, 256 или 128, значительно снижая требования к хранилищу при минимальных потерях в производительности.
  • Весовые коэффициенты доступны по лицензии Apache 2.0 на платформах Hugging Face и Kaggle; поддерживаются Ollama, llama.cpp, LiteRT и другие фреймворки.

Выпуск модели обеспечивает возможность конфиденциального поиска с дополнением генерации (RAG) и локального поиска, позволяя разработчикам выполнять встраивание непосредственно на устройствах без отправки данных в облако.