Un utilisateur a publié du code et des poids pour exécuter localement le modèle Cosmos3 de NVIDIA avec 64 milliards de paramètres en utilisant la quantification INT4. L'implémentation prend en charge les tâches Texte-vers-Image et Image-vers-Vidéo sur Apple Silicon via MLX, ainsi que CUDA.

  • Le dépôt fournit le code GitHub et les poids Hugging Face pour le modèle Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16.
  • La quantification permet d'exécuter le grand modèle de 64B paramètres sur du matériel grand public, la génération d'un clip prenant environ cinq minutes sur un Mac M4 Max avec 128 Go de mémoire.
  • Le projet inclut une comparaison avec Grok pour démontrer les capacités de performance.

Cette release permet l'inférence locale de modèles de génération d'images de pointe sur des appareils qui manquent généralement de la VRAM requise pour les poids en précision complète.