研究者らは、学習不要で入力が適応する推論手法であるReduced Matrix Multiplication (RMM)を提案した。これは、モデルの重みを変更せずに収縮次元に沿って情報的なスライスを選択することで、Transformerの行列積を削減する。単純な保持率制御の下、RMMは1Bから70Bパラメータの言語モデル全体で、精度と効率の滑らかで予測可能なトレードオフを提供する。
- 削減許容度はモデルファミリー、タスク、コンポーネント、保持率に依存し、モデル規模が大きくなるほど改善されることが多い。
- RMMは、適度な削減下で判別、自己回帰的生成、長文脈の設定全体で堅牢である。
- この原理はマルチモーダルなビジョン・ランゲージ推論にも拡張される。
- 機構的なアブレーションにより、注意機構側の計算がMLPコンポーネントよりも大幅に削減可能であることが明らかになった。
- NVIDIA A100上でのウォールクロックベンチマークは、特に長いシーケンス長において実用的な実行時間の改善を示した。
これらの結果は、RMMを入力適応型推論時の最適化のためのスケーラブルな方向性として位置づける。