A ByteDance Seed e o Tsinghua AIR introduziram o CUDA Agent, um sistema de aprendizado por reforço agéntico que treina o modelo de linguagem grande Seed1.6 para escrever kernels de GPU que superam os compiladores.
- O sistema utiliza treinamento PPO em 150 etapas com um contexto de 131.072 tokens dentro de uma sandbox de profiling e verificações de correção.
- Ele alcança uma taxa de aprovação de 98,8% e uma taxa de 96,8% mais rápida que o torch.compile no benchmark KernelBench, resultando em um aumento geométrico médio de velocidade de 2,11×.
- A equipe de pesquisa lançou o conjunto de dados CUDA-Agent-Ops-6K, a especificação SKILL.md e as receitas de recompensa, mas não os pesos do agente treinado.
- Abalações mostram que remover o loop do agente reduz a taxa mais rápida que o compilador de 96,8% para 14,1%, destacando a importância da abordagem agéntica.
O trabalho demonstra que colocar um LLM em um ambiente real de desenvolvimento CUDA com profiling iterativo pode fechar significativamente a lacuna de desempenho entre kernels gerados e aqueles escritos à mão ou gerados por compiladores.