Noah DeAngelis desenvolveu um mecanismo de atenção baseado em roteamento experimental para modelos GPT, implementado em um projeto PyTorch chamado RoutingGPT. A abordagem usa uma camada linear aprendida para selecionar um subconjunto de tokens como chaves e valores, mantendo todos os tokens como consultas.
- Com uma taxa de roteamento padrão de 25%, a complexidade é reduzida de T × T para atenção densa para T × 0.25T.
- O objetivo é reduzir o cálculo de atenção e permitir comprimentos de contexto maiores em hardware de baixo custo.
- O projeto é lançado sob a licença Apache 2.0 e atualmente é experimental, sem benchmarking rigoroso.