Google DeepMind выпустила технический отчет по Gemma 3, представляющий мультимодальное обновление семейства легких открытых моделей Gemma с объемом от 1 до 27 миллиардов параметров. Эта версия добавляет понимание изображений, поддерживает контекст как минимум на 128K токенов и изменяет архитектуру для снижения использования памяти KV-cache.
- Архитектура модели увеличивает соотношение локальных слоев внимания к глобальным и сохраняет короткие диапазоны локального внимания для управления памятью длинного контекста.
- Обучение использует дистилляцию с новым рецептом постобучения, который значительно улучшает математические способности, чат, следование инструкциям и многоязычность.
- Gemma3-4B-IT демонстрирует производительность, сопоставимую с Gemma2-27B-IT, а Gemma3-27B-IT конкурентоспособна с Gemini-1.5-Pro по бенчмаркам.
Авторы публикуют все модели для сообщества, стремясь обеспечить превосходную производительность по сравнению с предыдущими версиями как для предварительно обученных, так и для дообученных приложений.