一位开发者发布了 NVIDIA Nemotron-3-Nano-Omni-30B 模型的完整 GGUF 包,为 llama.cpp 生态系统添加了此前缺失的音频和视频支持。该发布版包含从 Q3_K_M 到 BF16 的九种量化版本,以及一个集成 C-RADIO 视觉编码器和 Parakeet 音频编码器的统一投影器文件。
- 专用的 llama.cpp fork 实现了 Parakeet/FastConformer 音频图和 C-RADIO 视频图,支持对带有音轨的视频进行一次性处理。
- 视频图的相对 L2 误差与 NVIDIA 的 PyTorch 参考实现匹配至 0.0019%,而音频图逐字转录测试旁白。
- 提供了适用于 DGX Spark 和 Jetson Thor 等硬件的预构建 Linux arm64 CUDA 13 二进制文件。
此更新允许用户在兼容硬件上通过单个 llama-server 实例同时运行图像、文本、音频和视频模态。