あるユーザーが、RTX Pro 6000 Blackwell GPU上でNVFP4量子化されたQwen3.6-35B-A3Bモデルを実行し、30の並列画像キャプションングストリームを処理しながら合計スループットで約2000トークン/秒を達成しました。 この構成は、高い同時実行性を管理するためにFLASHINFER注意機構バックエンドとプレフィックスキャッシングを使用するvLLMを利用しています。Mixture of Experts (MoE) アーキテクチャは、高い同時実行レベルでも約53-61%のエキスパートのみを活性化するため、より大きなパラメータ数にもかかわらず密接モデルを上回るパフォーマンスを発揮します。 このセットアップは、Blackwellハードウェア上のNVFP4量子化がVRAMを使い果たすことなく、大きな並列性を持つマルチモーダルワークロードを効率的に処理できることを証明しています。
Blackwell上のNVFP4 Qwen3.6-35B-A3Bが30並列ストリームで~2000 tpsを達成
統合されたGGUFとllama.cppフォークがNemotron-3-Nano-Omniに音声および動画対応をもたらす
著者は、不完全なプロジェクターファイルと欠落した推論グラフにより音声・動画入力が無視されていた、Nemotron-3-Nano-Omni-30Bの一般的なGGUFバージョンにおけるサイレントフォールトに対処しています。これを修正するため、ビジョンタワー、完全なParakeet/FastConformer音声エンコーダー、および時間的動画埋め込み器を含む統合されたmmprojファイルが、専用llama.cppフォークと共にリリースされました。
ゼロショットのNemotron 3.5 Lightning Omniが幾何学的一致により視覚と音声に対応
著者は、テキスト専用のNemotron 3.5 LightningモデルにNVIDIAのNemotron-3-Nano-Omniから事前学習済みのプロジェクターを取り付けることで、追加のトレーニングなしで画像と音声の理解を可能にするNemotron 3.5 Lightning-Omniを作成しました。
NVIDIAがGB300 NVL72上でQwen 3.8 2.4TをGPUあたり4K tok/sで提供
NVIDIAは、構成可能な推論機能を持つQwen 3.8 2.4Tパラメータモデルを、そのGB300 NVL72ハードウェアプラットフォーム上で提供することをデモンストレーションしました。
Microsoft、コーデックネイティブのストリーミングマルチモーダルモデル「Mage-VL」をリリース
Microsoftは、画像および動画の理解のために設計された効率的な4Bパラメータのマルチモーダル基盤モデル「Mage-VL」をリリースした。このモデルは視覚処理を効率化するためにコーデックネイティブのアプローチを採用している。システムは動画ストリームをアンカー(I)フレームと予測(P)フレームに分離し、コーデックがビットを割り当てるパッチのみを保持することで、視覚トークンの消費量を75%以上削減する。
調整なしのQwen3.6-27Bがエージェントタスクにおいて調整済みNemotron Puzzle-75Bを上回る
エージェント機能の評価により、調整なしのQwen3.6-27Bモデルは6〜9回のツール呼び出しで全てのテストされたタスクを正常に完了したのに対し、調整済みのNemotron Puzzle-75Bは手動で調整されたプロンプトと大幅に多いターン数を必要とした。