Noah DeAngelis ha desarrollado un mecanismo de atención basado en enrutamiento experimental para modelos GPT, implementado en un proyecto PyTorch llamado RoutingGPT. El enfoque utiliza una capa lineal aprendida para seleccionar un subconjunto de tokens como claves y valores, manteniendo todos los tokens como consultas.
- Con una relación de enrutamiento predeterminada del 25%, la complejidad se reduce de T × T para atención densa a T × 0.25T.
- El objetivo es reducir el cálculo de atención y permitir longitudes de contexto más largas en hardware de gama baja.
- El proyecto se publica bajo la licencia Apache 2.0 y actualmente es experimental sin una evaluación rigurosa.