A Google apresenta o Gemma 3, uma nova família de modelos multimodais abertos e leves que variam de 1 a 27 bilhões de parâmetros. Esta atualização adiciona compreensão visual, suporte para pelo menos 128K tokens de contexto e cobertura multilíngue ampliada em comparação com versões anteriores.
- Os modelos utilizam um codificador visual SigLIP personalizado com um método Pan & Scan para resolução flexível de imagens.
- As alterações na arquitetura incluem uma intercalação de 5:1 entre camadas de atenção local e global para reduzir o uso de memória do KV-cache durante a inferência de contexto longo.
- O modelo 1B suporta contexto de 32K, enquanto os modelos maiores suportam 128K tokens.
- O treinamento emprega destilação de conhecimento dos modelos fronteira Gemini e uma nova receita de pós-treinamento.
- Gemma3-4B-IT iguala o desempenho do Gemma2-27B-IT, e Gemma3-27B-IT é comparável ao Gemini-1.5-Pro em benchmarks.
O lançamento disponibiliza todas as variantes dos modelos para a comunidade, permitindo capacidades multimodais poderosas em hardware de consumo padrão.