A Meta anunciou o lançamento do Llama 4 Scout e do Llama 4 Maverick, apresentando os primeiros modelos nativamente multimodais de pesos abertos construídos com uma arquitetura de mistura de especialistas (MoE). Esses modelos foram projetados para apoiar todo o ecossistema Llama com suporte sem precedentes ao comprimento de contexto e capacidades eficientes de implantação.
- O Llama 4 Scout possui 17 bilhões de parâmetros ativos com 16 especialistas, cabendo em uma única GPU H100 com quantização Int4 e suportando um comprimento de contexto de entrada de 10M.
- O Llama 4 Maverick usa 17 bilhões de parâmetros ativos com 128 especialistas roteados mais um especialista compartilhado, permitindo que seja executado em um único host H100 DGX enquanto reduz a latência de inferência.
- Ambos os modelos utilizam fusão precoce para integrar perfeitamente tokens de texto e visão, treinados em mais de 30 trilhões de tokens, incluindo conjuntos de dados diversos de texto, imagem e vídeo.
- A Meta também apresentou o Llama 4 Behemoth, um modelo professor que supera GPT-4.5, Claude Sonnet 3.7 e Gemini 2.0 Pro em benchmarks STEM como MATH-500 e GPQA Diamond.
O lançamento visa fornecer aos desenvolvedores inteligência multimodal eficiente e de alta qualidade para construir aplicações de próxima geração para consumidores e empresas.