著者は、不完全なプロジェクターファイルと欠落した推論グラフにより音声・動画入力が無視されていた、Nemotron-3-Nano-Omni-30Bの一般的なGGUFバージョンにおけるサイレントフォールトに対処しています。これを修正するため、ビジョンタワー、完全なParakeet/FastConformer音声エンコーダー、および時間的動画埋め込み器を含む統合されたmmprojファイルが、専用llama.cppフォークと共にリリースされました。
- 新しいmmprojは、C-RADIOビジョンタワー、24層のFastConformer音声エンコーダー、および時間的動画パッチ埋め込みを単一ファイルに統合しています。
- 専用llama.cppフォークは、EVSトークンプルーニングのサポートを含む必要な音声・動画推論グラフを実装しています。
- 検証により、動画グラフがNVIDIAのPyTorchリファレンスと0.0019パーセントの相対L2誤差および正確なEVS整合性で一致することが確認されました。
- モデルはHugging Face上で9つの量子化バージョンで利用可能ですが、音声・動画には現在フォークされたllama.cppバイナリが必要です。
この更新により、ユーザーは単一パスで画像、音声、動画入力を同時に処理できるようになり、将来的なアップストリームリリースでは音声プロジェクターレイアウトの統合が計画されています。