Google présente Gemma 3, une nouvelle famille de modèles multimodaux ouverts et légers allant de 1 à 27 milliards de paramètres. Cette mise à jour ajoute la compréhension visuelle, le support pour au moins 128K tokens de contexte, et une couverture multilingue élargie par rapport aux versions précédentes.
- Les modèles utilisent un encodeur visuel SigLIP sur mesure avec une méthode Pan & Scan pour une résolution d'image flexible.
- Les changements d'architecture incluent un entrelacement 5:1 des couches d'attention locale à globale pour réduire l'utilisation de la mémoire KV-cache lors de l'inférence à long contexte.
- Le modèle 1B supporte un contexte de 32K, tandis que les modèles plus grands supportent 128K tokens.
- L'entraînement utilise la distillation de connaissances depuis les modèles Gemini frontier et une nouvelle recette post-entraînement.
- Gemma3-4B-IT égale les performances de Gemma2-27B-IT, et Gemma3-27B-IT est comparable à Gemini-1.5-Pro sur les benchmarks.
La publication met toutes les variantes de modèles à disposition de la communauté, permettant des capacités multimodales puissantes sur du matériel grand public standard.