Meta a annoncé la publication de Llama 4 Scout et Llama 4 Maverick, introduisant les premiers modèles nativement multimodaux à poids ouverts construits avec une architecture mixture-of-experts (MoE). Ces modèles sont conçus pour prendre en l'ensemble de l'écosystème Llama avec un support de longueur de contexte sans précédent et des capacités de déploiement efficaces.
- Llama 4 Scout dispose de 17 milliards de paramètres actifs avec 16 experts, tenant sur un seul GPU H100 avec quantisation Int4 et prenant en charge une longueur de contexte d'entrée de 10M.
- Llama 4 Maverick utilise 17 milliards de paramètres actifs avec 128 experts routés plus un expert partagé, lui permettant de s'exécuter sur un seul hôte H100 DGX tout en réduisant la latence d'inférence.
- Les deux modèles utilisent une fusion précoce pour intégrer sans couture les jetons textuels et visuels, entraînés sur plus de 30 billions de jetons incluant des ensembles de données diversifiés de texte, d'images et de vidéos.
- Meta a également présenté Llama 4 Behemoth, un modèle enseignant qui surpasse GPT-4.5, Claude Sonnet 3.7 et Gemini 2.0 Pro sur les benchmarks STEM comme MATH-500 et GPQA Diamond.
La publication vise à fournir aux développeurs une intelligence multimodale efficace et de haute qualité pour construire des applications grand public et professionnelles de nouvelle génération.