ノア・デアンジェリスは、RoutingGPTという名前のPyTorchプロジェクトで実装された、GPTモデル用の実験的なルーティングベースの注意力機構を開発しました。このアプローチは、学習された線形層を使用してトークンのサブセットをキーと値として選択し、すべてのトークンをクエリとして保持します。
- デフォルトのルーティング比率25%の場合、密集注意力のT × TからT × 0.25Tに複雑さが削減されます。
- 目的は、注意力計算を削減し、低価格ハードウェアでより長いコンテキスト長を可能にすることです。
- このプロジェクトはApache 2.0ライセンスの下でリリースされており、現在厳格なベンチマークなしで実験的な段階にあります。