L'équipe KwaiKAT de Kuaishou a publié KAT-Coder-V2.5, un modèle de codage conçu pour fonctionner dans des environnements de dépôt réels et exécutables plutôt que de générer du code en une seule passe. L'équipe a également publié une variante à poids ouverts, KAT-Coder-V2.5-Dev, sur Hugging Face sous la licence Apache-2.0.
- AutoBuilder construit des triplets de tâches vérifiables (description, environnement, tests) à partir de vraies pull requests, faisant passer le taux de réussite de construction d'environnement de 16,5 % à 57,2 %.
- Le jeu de données résultant comprend plus de 100 000 environnements vérifiables couvrant 12 langages, avec l'historique git et les métadonnées des commits supprimés pour éviter la fuite des solutions.
- Une roue de mise à l'échelle des données filtre les trajectoires par la qualité du processus plutôt que par le simple succès final des tests, en utilisant des indices ciblés pour les cas presque réussis et des portes basées sur des règles pour les exécutions valides.
- Des corrections d'infrastructure ont réduit les erreurs de feedback du bac à sable d'environ 16 % à moins de 2 %, résolvant des problèmes tels que les délais d'utilisation du disque et la dérive des jetons dans le Gateway Server.
- L'entraînement utilise un PPO asymétrique avec un système de récompense à trois niveaux et une Distillation Multi-Enseignant On-Policy, en rejetant le contexte du critique privilégié lors de l'inférence.
KAT-Coder-V2.5 mène PinchBench avec un score de 94,9 et se classe deuxième sur SWE-Bench Pro avec 65,2, démontrant des performances améliorées dans les tâches de codage agentique.