Google DeepMind ha publicado el informe técnico de Gemma 3, presentando una actualización multimodal a la familia de modelos abiertos ligeros Gemma que van de 1 a 27 mil millones de parámetros. Esta versión añade comprensión visual, soporta al menos 128K tokens de contexto y modifica la arquitectura para reducir el uso de memoria KV-cache.
- La arquitectura del modelo aumenta la proporción de capas de atención local a global y mantiene los alcances de atención local cortos para gestionar la memoria de contexto largo.
- El entrenamiento utiliza destilación, con una nueva receta post-entrenamiento que mejora significativamente las capacidades matemáticas, chat, seguimiento de instrucciones y multilingüismo.
- Gemma3-4B-IT logra un rendimiento comparable a Gemma2-27B-IT, mientras que Gemma3-27B-IT es competitiva con Gemini-1.5-Pro en benchmarks.
Los autores liberan todos los modelos a la comunidad, con el objetivo de proporcionar un rendimiento superior sobre versiones anteriores tanto para aplicaciones preentrenadas como de ajuste fino por instrucciones.