Hugging Faceでの提案は、AIにおける2つの相互に関連する問題について議論しています:個別の大規模モデルのトレーニングへの依存と、エコシステムが汎用GPUに依存していることです。

  • 著者は「漸進的モデル成長」を提案しており、モデルが構造的に拡張される(例:4Bから8Bへ)際、各サイズごとにゼロから始めるのではなく、学習された表現を保持します。
  • このアプローチは固定サイズの知識転送を補完し、構造的な拡張が必要になる前にモデルがより多くの能力を吸収することを可能にします。
  • ハードウェアの制限に対処するため、著者はTransformer用の「AIハードウェアプロファイル」を提案し、専用ASICベンダー向けの一般的な操作(GEMMやアテンションなど)の安定したセットを定義しています。
  • 提案では、モデルリリースはパラメータ数 alongside トークンあたりのジュール量やメモリ要件などの効率指標をベンチマークすべきだと主張しています。

著者はこれらの変更がローカルAIユーザーのVRAM制限の克服に役立ち、ハードウェアメーカーにとって明確な最適化目標を提供できると考えています。