Google представляет Gemma 3, новое семейство легких открытых мультимодальных моделей с количеством параметров от 1 до 27 миллиардов. Это обновление добавляет понимание изображений, поддержку как минимум 128K токенов контекста и расширенное покрытие множества языков по сравнению с предыдущими версиями.

  • Модели используют специализированный визуальный энкодер SigLIP с методом Pan & Scan для гибкого разрешения изображений.
  • Изменения в архитектуре включают чередование слоев локального и глобального внимания в соотношении 5:1 для снижения использования памяти KV-cache во время вывода с длинным контекстом.
  • Модель на 1B поддерживает контекст на 32K токенов, тогда как более крупные модели поддерживают 128K токенов.
  • Обучение использует дистилляцию знаний от передовых моделей Gemini и новый рецепт постобучения.
  • Gemma3-4B-IT сопоставима по производительности с Gemma2-27B-IT, а Gemma3-27B-IT сопоставима с Gemini-1.5-Pro на бенчмарках.

Выпуск предоставляет все варианты моделей сообществу, позволяя реализовывать мощные мультимодальные возможности на стандартном потребительском оборудовании.