Seorang pengguna telah menerbitkan kode dan bobot untuk menjalankan model Cosmos3 NVIDIA dengan 64 miliar parameter secara lokal menggunakan kuantisasi INT4. Implementasi ini mendukung tugas Text-to-Image dan Image-to-Video di Apple Silicon melalui MLX serta CUDA.

  • Repositori menyediakan kode GitHub dan bobot Hugging Face untuk model Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16.
  • Kuantisasi memungkinkan model besar 64B parameter berjalan pada perangkat konsumen, dengan satu generasi klip memakan waktu sekitar lima menit di Mac M4 Max dengan memori 128 GB.
  • Proyek ini mencakup perbandingan dengan Grok untuk mendemonstrasikan kemampuan kinerja.

Rilis ini memungkinkan inferensi lokal dari model generasi gambar terkini pada perangkat yang biasanya tidak memiliki VRAM yang diperlukan untuk bobot presisi penuh.