一位用户发布了在本地运行 NVIDIA 640 亿参数 Cosmos3 模型的代码和权重,采用 INT4 量化。该实现在 Apple Silicon 上通过 MLX 以及 CUDA 支持文本到图像和图像到视频任务。

  • 该仓库提供了 Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16 模型的 GitHub 代码和 Hugging Face 权重。
  • 量化使得拥有 64B 参数的大型模型能够在消费级硬件上运行,在配备 128 GB 内存的 M4 Max Mac 上生成一个片段大约需要五分钟。
  • 该项目包含与 Grok 的性能对比演示。

此发布版本使得在通常缺乏全精度权重所需 VRAM 的设备上本地推理最先进的图像生成模型成为可能。