開発者がNVIDIAのNemotron-3-Nano-Omni-30Bモデル用の完全なGGUFパッケージをリリースし、llama.cppエコシステムに以前欠けていた音声および動画のサポートを追加しました。このリリースにはQ3_K_MからBF16までの9種類の量子化と、C-RADIOビジョンエンコーダーとParakeet音声エンコーダーの両方を統合するユニファイドプロジェクターファイルが含まれています。

  • llama.cppの専用フォークがParakeet/FastConformer音声グラフとC-RADIO動画グラフを実装し、サウンドトラック付き動画の一括処理を可能にしています。
  • 動画グラフはNVIDIAのPyTorchリファレンスに対して0.0019パーセントの相対L2誤差で一致し、音声グラフはテストナレーションを単語単位で正確に文字起こしします。

DGX SparkやJetson Thorなどのハードウェア向けに、Linux arm64 CUDA 13のビルド済みバイナリが提供されています。

このアップデートにより、ユーザーは互換性のあるハードウェア上で単一のllama-serverインスタンスを通じて画像、テキスト、音声、動画の各モダリティを同時に実行できるようになります。