Пользователь опубликовал код и веса для локального запуска модели Cosmos3 от NVIDIA с 64 миллиардами параметров с использованием INT4-квантования. Реализация поддерживает задачи Text-to-Image и Image-to-Video на Apple Silicon через MLX, а также CUDA.
- Репозиторий предоставляет код на GitHub и веса на Hugging Face для модели Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16.
- Квантование позволяет запускать большую модель с 64B параметров на потребительском оборудовании; генерация одного клипа занимает около пяти минут на Mac M4 Max с 128 ГБ памяти.
- Проект включает сравнение с Grok для демонстрации возможностей производительности.
Этот релиз позволяет выполнять локальный инференс моделей генерации изображений нового поколения на устройствах, которые обычно не имеют VRAM, необходимого для весов полной точности.