Meta a publié Muse Glimmer, un modèle multimodal dense de 30 milliards de paramètres optimisé pour les flux de travail d'agents locaux en continu. Les poids sont disponibles sous licence Apache 2.0.

  • Quantifié à ~4 bits, le modèle tient en moins de 20 Go, laissant de la marge pour le cache KV et le décodage spéculatif sur du matériel grand public avec 24 Go ou 32 Go de mémoire.
  • Livré avec un prédictor léger basé sur DFlash pour le décodage spéculatif, permettant une génération de tokens significativement plus rapide avec une qualité de sortie identique.
  • Entraîné sur plus de 100 langues avec un effort de raisonnement contrôlable pour équilibrer qualité et vitesse.
  • Optimisé pour les tâches agentic incluant l'achèvement de tâche de bout en bout, l'appel de fonctions, le raisonnement multi-étapes et la récupération d'échecs.

Cette publication vise à permettre l'exécution locale efficace de boucles d'agents complexes en réduisant l'empreinte mémoire tout en maintenant les performances sur des benchmarks comme DeepSearch QA et SWE-Bench.