作者解决了 Nemotron-3-Nano-Omni-30B 的流行 GGUF 版本中存在的静默失败问题,由于投影器文件不完整且推理图缺失,导致音频和视频输入被忽略。为解决此问题,已发布一个包含视觉塔、完整的 Parakeet/FastConformer 音频编码器和时序视频嵌入器的统一 mmproj 文件,以及一个专门的 llama.cpp 分支。
- 新的 mmproj 将 C-RADIO 视觉塔、24 层 FastConformer 音频编码器和时序视频块嵌入合并为单个文件。
- 专用的 llama.cpp 分支实现了必要的音频和视频推理图,包括对 EVS token 剪枝的支持。
- 验证确认视频图与 NVIDIA 的 PyTorch 参考实现匹配,相对 L2 误差为 0.0019%,且 EVS 完全一致。
- 该模型在 Hugging Face 上提供九种量化版本,而音频和视频目前需要分支后的 llama.cpp 二进制文件。
此更新允许用户在单次传递中同时处理图像、音频和视频输入,并计划在未来上游版本中集成音频投影器布局。