El equipo KwaiKAT de Kuaishou ha lanzado KAT-Coder-V2.5, un modelo de codificación diseñado para operar dentro de entornos de repositorios reales y ejecutables, en lugar de generar código en un solo turno. El equipo también publicó una variante de pesos abiertos, KAT-Coder-V2.5-Dev, en Hugging Face bajo la licencia Apache-2.0.
- AutoBuilder construye tripletes de tareas verificables (descripción, entorno, pruebas) a partir de solicitudes de extracción reales, elevando las tasas de éxito en la construcción del entorno del 16,5 % al 57,2 %.
- El conjunto de datos resultante incluye más de 100.000 entornos verificables que abarcan 12 lenguajes, con el historial de git y los metadatos de confirmación eliminados para evitar la filtración de soluciones.
- Una rueda de escala de datos filtra las trayectorias por la calidad del proceso en lugar de solo el éxito final de las pruebas, utilizando pistas dirigidas para casos cercanos al fallo y compuertas basadas en reglas para ejecuciones exitosas.
- Las correcciones de infraestructura redujeron los errores de retroalimentación del sandbox de ~16 % a menos del 2 %, abordando problemas como los tiempos de espera por uso de disco y la deriva de tokens en el Gateway Server.
- El entrenamiento utiliza PPO asimétrico con un sistema de recompensas de tres niveles y Distilación On-Policy Multi-Maestro, descartando el contexto del crítico privilegiado durante la inferencia.
KAT-Coder-V2.5 lidera PinchBench con una puntuación de 94,9 y ocupa el segundo lugar en SWE-Bench Pro con 65,2, demostrando un rendimiento mejorado en tareas de codificación agente.