Google DeepMind выпустила EmbeddingGemma 2, модель встраивания с открытым исходным кодом для работы с мультимодальными данными, которая преобразует текст, код, изображения, видео и аудио в единое 768-мерное векторное пространство. Модель содержит 740 миллионов параметров в целом, объединяя текстовый энкодер на 270M параметров с модульными визуальным (170M) и аудиальным (300M) энкодерами.

  • Предназначена для работы на потребительском оборудовании, таком как мобильные устройства и ноутбуки, для получения семантических представлений с низкой задержкой.
  • Поддерживает приложения на устройстве, включая поиск, генерацию с дополнением через извлечение (RAG), классификацию и кластеризацию.
  • Доступна как открытая модель через Hugging Face.