Пользователь опубликовал код и веса для локального запуска модели Cosmos3 от NVIDIA с 64 миллиардами параметров с использованием INT4-квантования. Реализация поддерживает задачи Text-to-Image и Image-to-Video на Apple Silicon через MLX, а также CUDA.

  • Репозиторий предоставляет код на GitHub и веса на Hugging Face для модели Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16.
  • Квантование позволяет запускать большую модель с 64B параметров на потребительском оборудовании; генерация одного клипа занимает около пяти минут на Mac M4 Max с 128 ГБ памяти.
  • Проект включает сравнение с Grok для демонстрации возможностей производительности.

Этот релиз позволяет выполнять локальный инференс моделей генерации изображений нового поколения на устройствах, которые обычно не имеют VRAM, необходимого для весов полной точности.