Les chercheurs ont présenté Twill, un système qui formule le pipelining logiciel (SWP) et la spécialisation de warp (WS) comme un problème d'optimisation conjointe résoluble par des solveurs de contraintes prêts à l'emploi. Cette approche automatise la dérivation de plannings d'exécution optimaux pour les programmes itératifs sur les architectures GPU.

  • Twill est exempt d'heuristiques et garantit de produire des plannings optimaux pour une large classe de programmes itératifs.
  • Le système peut redécouvrir et prouver l'optimalité des plannings SWP et WS développés manuellement par des experts pour Flash Attention.
  • La validation a été effectuée sur les architectures GPU NVIDIA Hopper et Blackwell.

En remplaçant les heuristiques de compilation fragiles et l'intuition humaine par une optimisation holistique, Twill assure une utilisation maximale des unités à fonction fixe et des cœurs à usage général dans les GPU modernes complexes.