Noah DeAngelis 开发了一种用于 GPT 模型的实验性基于路由的注意力机制,该机制在一个名为 RoutingGPT 的 PyTorch 项目中实现。该方法使用一个可学习的线性层来选择一部分 token 作为键和值,同时保留所有 token 作为查询。

  • 在默认 25% 的路由比例下,复杂度从密集注意力的 T × T 降低到 T × 0.25T。
  • 目标是减少注意力计算量,并在低端硬件上支持更长的上下文长度。
  • 该项目以 Apache 2.0 许可证发布,目前处于实验阶段,尚未经过严格的基准测试。