Hugging Faceフォーラムでの提案は、NVIDIA、AMD、Intelといった特定のハードウェアベンダーからアプリケーションコードを切り離すために設計された共通のGPU実行およびメモリ管理レイヤーについて述べています。この目的は、ユーザーがバックエンド固有のフラグ、デバイスマップ、またはオフロード戦略を手動で設定するのではなく、メモリ予算を指定できるようにすることです。
- ランタイムは、利用可能なVRAMに基づいてレイヤー配置、精度選択(INT4、INT8、FP8)、およびKVキャッシュ管理を自動的に決定します。
- GPUローカルVRAM、拡張メモリ、システムRAM、NVMeストレージのティアを持つ階層型メモリモデルを導入します。
- 量子化の利点を無効にするデ量子化バッファを防ぐため、低ビットデータ型を第一級のランタイム機能として提案しています。
- このアーキテクチャは、12 GBのコンシューマーGPUで13BクラスのINT4推論を実用的なものにすることを目指し、ランタイム全体のメモリフットプリントを制御します。
このアプローチは、断片化されたソフトウェアの互換性とVRAMの制限に対処し、CUDAや他のベンダー固有のバックエンドへの密結合を必要とせずに、マルチベンダーGPU市場全体でAIワークロードが効率的に実行されることを可能にすることを目指しています。