Noah DeAngelis a développé un mécanisme d'attention basé sur le routage expérimental pour les modèles GPT, implémenté dans un projet PyTorch nommé RoutingGPT. L'approche utilise une couche linéaire apprise pour sélectionner un sous-ensemble de tokens comme clés et valeurs, tout en conservant tous les tokens comme requêtes.
- Avec un ratio de routage par défaut de 25 %, la complexité passe de T × T pour l'attention dense à T × 0.25T.
- L'objectif est de réduire le calcul d'attention et de permettre des longueurs de contexte plus longues sur du matériel entrée de gamme.
- Le projet est publié sous la licence Apache 2.0 et est actuellement expérimental sans benchmarking rigoureux.