Google presenta Gemma 3, una nueva familia de modelos multimodales abiertos y ligeros que van de 1 a 27 mil millones de parámetros. Esta actualización añade comprensión visual, soporte para al menos 128K tokens de contexto y cobertura multilingüe ampliada en comparación con las versiones anteriores.

  • Los modelos utilizan un codificador visual SigLIP personalizado con un método Pan & Scan para resolución de imagen flexible.
  • Los cambios arquitectónicos incluyen una intercalación 5:1 de capas de atención local a global para reducir el uso de memoria del KV-cache durante la inferencia de contexto largo.
  • El modelo 1B soporta contexto de 32K, mientras que los modelos más grandes soportan 128K tokens.
  • El entrenamiento emplea destilación de conocimiento desde modelos frontales Gemini y una nueva receta de post-entrenamiento.
  • Gemma3-4B-IT iguala el rendimiento de Gemma2-27B-IT, y Gemma3-27B-IT es comparable a Gemini-1.5-Pro en benchmarks.

El lanzamiento pone todas las variantes del modelo a disposición de la comunidad, habilitando potentes capacidades multimodales en hardware estándar para consumidores.