ByteDance Seed dan Tsinghua AIR telah memperkenalkan CUDA Agent, sebuah sistem pembelajaran penguatan agentic yang melatih model bahasa besar Seed1.6 untuk menulis kernel GPU yang melebihi kinerja kompiler.

  • Sistem ini menggunakan pelatihan PPO selama 150 langkah dengan konteks 131.072-token di dalam sandbox profil dan pemeriksaan kebenaran.
  • Sistem ini mencapai tingkat lulus 98,8% dan tingkat lebih cepat dari torch.compile sebesar 96,8% pada benchmark KernelBench, menghasilkan percepatan rata-rata geometris 2,11×.
  • Tim peneliti merilis dataset CUDA-Agent-Ops-6K, spesifikasi SKILL.md, dan resep reward, tetapi tidak merilis bobot agen yang telah dilatih.
  • Ablasi menunjukkan bahwa menghapus loop agen menurunkan tingkat lebih cepat dari kompiler dari 96,8% menjadi 14,1%, menyoroti pentingnya pendekatan agentic.

Penelitian ini menunjukkan bahwa menempatkan LLM dalam lingkungan pengembangan CUDA nyata dengan profil iteratif dapat secara signifikan mengurangi kesenjangan kinerja antara kernel yang dihasilkan dan yang ditulis tangan atau dihasilkan oleh kompiler.