Appleは第3世代ファウンデーションモデル(AFM3)用の新しいアーキテクチャを導入し、「指示追従プルーニング」を活用してアクティブなパラメータ数を大幅に削減しました。このモデルは、トークンごとではなくプロンプトごとにルーティング判断を行うことで、MLPレイヤーの約20%をアクティブ化するように設計されています。
- システムはモデル全体をフラッシュストレージに保持し、同時に作業メモリにロードされるのは「エキスパート」パラメータのごく一部(10億〜40億個)のみです。
- 共有エキスパートのコア部分は常にアクティブなままになり、残りのパラメータは入力プロンプトに基づいてオンデマンドでロードされます。
- このアプローチにより、30BのアクティブなMoEが14Bのアクティブモデルと同等の読み取り帯域幅パフォーマンスを達成し、9Bの密モデルを実質的に3Bのアクティブモデルに変換します。
この方法は、スパースな活性化パターンを通じてパフォーマンスを維持しつつメモリ使用量を最小化することで、効率性の向上を目指しています。