ByteDance Seed et Tsinghua AIR ont présenté CUDA Agent, un système d'apprentissage par renforcement agentic qui entraîne le grand modèle de langage Seed1.6 à écrire des noyaux GPU surpassant les compilateurs.
- Le système utilise l'entraînement PPO sur 150 étapes avec un contexte de 131 072 tokens dans un bac à sable de profilage et des vérifications de correction.
- Il atteint un taux de réussite de 98,8 % et un taux de 96,8 % plus rapide que torch.compile sur le benchmark KernelBench, offrant un gain de vitesse moyen géométrique de 2,11×.
- L'équipe de recherche a publié le jeu de données CUDA-Agent-Ops-6K, la spécification SKILL.md et les recettes de récompense, mais pas les poids de l'agent entraîné.
- Les ablations montrent que la suppression de la boucle agent fait chuter le taux plus rapide que le compilateur de 96,8 % à 14,1 %, soulignant l'importance de l'approche agentic.
Ce travail démontre que placer un LLM dans un environnement de développement CUDA réel avec un profilage itératif peut considérablement réduire l'écart de performance entre les noyaux générés et ceux écrits à la main ou générés par un compilateur.