ByteDance Seed y Tsinghua AIR han presentado CUDA Agent, un sistema de aprendizaje por refuerzo agéntico que entrena el modelo de lenguaje grande Seed1.6 para escribir núcleos de GPU que superan a los compiladores.

  • El sistema utiliza entrenamiento PPO durante 150 pasos con un contexto de 131.072 tokens dentro de una caja de arena de perfilado y verificaciones de corrección.
  • Alcanza una tasa de aprobación del 98,8% y una tasa de 96,8% más rápido que torch.compile en el benchmark KernelBench, lo que produce un aumento geométrico medio de la velocidad de 2,11×.
  • El equipo de investigación ha publicado el conjunto de datos CUDA-Agent-Ops-6K, la especificación SKILL.md y las recetas de recompensa, pero no los pesos del agente entrenado.
  • Las ablativos muestran que eliminar el bucle del agente reduce la tasa de ser más rápido que el compilador del 96,8% al 14,1%, destacando la importancia del enfoque agéntico.

El trabajo demuestra que colocar un LLM en un entorno real de desarrollo CUDA con perfilado iterativo puede cerrar significativamente la brecha de rendimiento entre los núcleos generados y los escritos a mano o generados por el compilador.