Um usuário publicou código e pesos para executar o modelo Cosmos3 da NVIDIA com 64 bilhões de parámetros localmente usando quantização INT4. A implementação suporta tarefas de Texto para Imagem e Imagem para Vídeo no Apple Silicon via MLX, bem como CUDA.
- O repositório fornece código no GitHub e pesos no Hugging Face para o modelo Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16.
- A quantização permite que o grande modelo de 64B parámetros rode em hardware de consumo, com uma geração de clipe levando aproximadamente cinco minutos em um Mac M4 Max com 128 GB de memória.
- O projeto inclui uma comparação com o Grok para demonstrar capacidades de desempenho.
Este lançamento permite a inferência local de modelos de geração de imagens de última geração em dispositivos que tipicamente não possuem VRAM suficiente para pesos de precisão completa.