A Meta anunciou o lançamento do Llama 4 Scout e do Llama 4 Maverick, apresentando os primeiros modelos nativamente multimodais de pesos abertos construídos com uma arquitetura de mistura de especialistas (MoE). Esses modelos foram projetados para apoiar todo o ecossistema Llama com suporte sem precedentes ao comprimento de contexto e capacidades eficientes de implantação.

  • O Llama 4 Scout possui 17 bilhões de parâmetros ativos com 16 especialistas, cabendo em uma única GPU H100 com quantização Int4 e suportando um comprimento de contexto de entrada de 10M.
  • O Llama 4 Maverick usa 17 bilhões de parâmetros ativos com 128 especialistas roteados mais um especialista compartilhado, permitindo que seja executado em um único host H100 DGX enquanto reduz a latência de inferência.
  • Ambos os modelos utilizam fusão precoce para integrar perfeitamente tokens de texto e visão, treinados em mais de 30 trilhões de tokens, incluindo conjuntos de dados diversos de texto, imagem e vídeo.
  • A Meta também apresentou o Llama 4 Behemoth, um modelo professor que supera GPT-4.5, Claude Sonnet 3.7 e Gemini 2.0 Pro em benchmarks STEM como MATH-500 e GPQA Diamond.

O lançamento visa fornecer aos desenvolvedores inteligência multimodal eficiente e de alta qualidade para construir aplicações de próxima geração para consumidores e empresas.