Google DeepMind выпустила EmbeddingGemma 2, модель встраивания с открытым исходным кодом для работы с мультимодальными данными, которая преобразует текст, код, изображения, видео и аудио в единое 768-мерное векторное пространство. Модель содержит 740 миллионов параметров в целом, объединяя текстовый энкодер на 270M параметров с модульными визуальным (170M) и аудиальным (300M) энкодерами.
- Предназначена для работы на потребительском оборудовании, таком как мобильные устройства и ноутбуки, для получения семантических представлений с низкой задержкой.
- Поддерживает приложения на устройстве, включая поиск, генерацию с дополнением через извлечение (RAG), классификацию и кластеризацию.
- Доступна как открытая модель через Hugging Face.