Un usuario ha publicado código y pesos para ejecutar el modelo Cosmos3 de NVIDIA con 64 mil millones de parámetros localmente utilizando cuantización INT4. La implementación soporta tareas de Texto a Imagen e Imagen a Video en Apple Silicon vía MLX, así como CUDA.

  • El repositorio proporciona código en GitHub y pesos en Hugging Face para el modelo Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16.
  • La cuantización permite que el gran modelo de 64B parámetros se ejecute en hardware de consumo, con una generación de clip que toma aproximadamente cinco minutos en un Mac M4 Max con 128 GB de memoria.
  • El proyecto incluye una comparación con Grok para demostrar las capacidades de rendimiento.

Este lanzamiento permite la inferencia local de modelos de generación de imágenes de última generación en dispositivos que típicamente carecen del VRAM requerido para pesos de precisión completa.