Penulis menangani kegagalan diam pada versi GGUF populer dari Nemotron-3-Nano-Omni-30B, di mana input audio dan video diabaikan karena file projector yang tidak lengkap dan grafik inferensi yang hilang. Untuk memperbaikinya, file mmproj terpadu yang berisi menara visi, encoder audio Parakeet/FastConformer penuh, dan penanam video temporal telah dirilis bersama fork llama.cpp khusus.

  • mmproj baru menggabungkan menara visi C-RADIO, encoder audio FastConformer 24 lapis, dan penanam patch video temporal ke dalam satu file.
  • Fork llama.cpp khusus mengimplementasikan grafik inferensi audio dan video yang diperlukan, termasuk dukungan untuk pemangkasan token EVS.
  • Verifikasi mengonfirmasi bahwa grafik video cocok dengan referensi PyTorch NVIDIA dengan kesalahan L2 relatif 0,0019 persen dan kesetaraan EVS yang tepat.
  • Model tersedia dalam sembilan kuantisasi di Hugging Face, sementara audio dan video saat ini memerlukan biner llama.cpp yang di-fork.

Pembaruan ini memungkinkan pengguna memproses input gambar, audio, dan video secara bersamaan dalam satu langkah, dengan rilis upstream masa depan direncanakan untuk mengintegrasikan tata letak projector audio.