Meta ha anunciado el lanzamiento de Llama 4 Scout y Llama 4 Maverick, presentando los primeros modelos nativamente multimodales de pesos abiertos construidos con una arquitectura de mezcla de expertos (MoE). Estos modelos están diseñados para apoyar todo el ecosistema Llama con un soporte sin precedentes para la longitud del contexto y capacidades eficientes de implementación.

  • Llama 4 Scout cuenta con 17 mil millones de parámetros activos con 16 expertos, cabe en una sola GPU H100 con cuantización Int4 y soporta una longitud de contexto de entrada de 10M.
  • Llama 4 Maverick utiliza 17 mil millones de parámetros activos con 128 expertos enrutados más un experto compartido, permitiendo que se ejecute en un solo host H100 DGX mientras reduce la latencia de inferencia.
  • Ambos modelos utilizan fusión temprana para integrar sin problemas tokens de texto y visión, entrenados con más de 30 billones de tokens que incluyen diversos conjuntos de datos de texto, imagen y video.
  • Meta también presentó a Llama 4 Behemoth, un modelo maestro que supera a GPT-4.5, Claude Sonnet 3.7 y Gemini 2.0 Pro en benchmarks STEM como MATH-500 y GPQA Diamond.

El lanzamiento tiene como objetivo proporcionar a los desarrolladores inteligencia multimodal eficiente y de alta calidad para construir aplicaciones de próxima generación para consumidores y empresas.