Google DeepMind a publié le rapport technique de Gemma 3, présentant une mise à jour multimodale de la famille de modèles ouverts légers Gemma allant de 1 à 27 milliards de paramètres. Cette version ajoute la compréhension visuelle, prend en charge au moins 128K tokens de contexte et modifie l'architecture pour réduire l'utilisation de la mémoire KV-cache.

  • L'architecture du modèle augmente le ratio des couches d'attention locale par rapport à globale et maintient les portées d'attention locale courtes pour gérer la mémoire de contexte long.
  • L'entraînement utilise la distillation, avec une nouvelle recette post-entraînement qui améliore significativement les capacités mathématiques, le chat, le suivi d'instructions et le multilinguisme.
  • Gemma3-4B-IT atteint des performances comparables à Gemma2-27B-IT, tandis que Gemma3-27B-IT est compétitive face à Gemini-1.5-Pro sur les benchmarks.

Les auteurs publient tous les modèles à la communauté, visant à fournir des performances supérieures aux versions précédentes pour les applications pré-entraînées et finement ajustées par instructions.