Tim KwaiKAT di Kuaishou telah merilis KAT-Coder-V2.5, sebuah model koding yang dirancang untuk beroperasi dalam lingkungan repositori nyata yang dapat dieksekusi, bukan hanya menghasilkan kode satu putaran. Tim tersebut juga mempublikasikan varian bobot terbuka, KAT-Coder-V2.5-Dev, di Hugging Face di bawah lisensi Apache-2.0.
- AutoBuilder membangun triplet tugas yang dapat diverifikasi (deskripsi, lingkungan, tes) dari permintaan tarik nyata, meningkatkan tingkat keberhasilan konstruksi lingkungan dari 16,5% menjadi 57,2%.
- Dataset yang dihasilkan mencakup lebih dari 100.000 lingkungan yang dapat diverifikasi yang merentang pada 12 bahasa, dengan riwayat git dan metadata komit dihapus untuk mencegah kebocoran solusi.
- Roda gila penskalaan data memfilter lintasan berdasarkan kualitas proses daripada hanya keberhasilan tes akhir, menggunakan petunjuk terarah untuk kasus hampir berhasil dan gerbang berbasis aturan untuk jalanan yang lolos.
- Perbaikan infrastruktur mengurangi kesalahan umpan balik sandbox dari ~16% menjadi di bawah 2%, mengatasi masalah seperti batas waktu penggunaan disk dan drift token di Gateway Server.
- Pelatihan memanfaatkan PPO asimetris dengan sistem hadiah tiga tingkat dan Distilasi On-Policy Multi-Guru, membuang konteks kritikus istimewa saat inferensi.
KAT-Coder-V2.5 memimpin PinchBench dengan skor 94,9 dan menempati peringkat kedua di SWE-Bench Pro dengan 65,2, menunjukkan peningkatan kinerja dalam tugas koding agentic.