A equipe KwaiKAT da Kuaishou lançou o KAT-Coder-V2.5, um modelo de codificação projetado para operar dentro de repositórios reais e executáveis, em vez de gerar código em uma única interação. A equipe também publicou uma variante de pesos abertos, KAT-Coder-V2.5-Dev, no Hugging Face sob a licença Apache-2.0.
- O AutoBuilder constrói triplas de tarefas verificáveis (descrição, ambiente e testes) a partir de pull requests reais, elevando as taxas de sucesso na construção do ambiente de 16,5% para 57,2%.
- O conjunto de dados resultante inclui mais de 100.000 ambientes verificáveis abrangendo 12 idiomas, com histórico do git e metadados de commit removidos para evitar vazamento de soluções.
- Uma roda de escalação de dados filtra trajetórias pela qualidade do processo em vez de apenas pelo sucesso final dos testes, usando dicas direcionadas para casos quase bem-sucedidos e filtros baseados em regras para execuções aprovadas.
Correções na infraestrutura reduziram os erros de feedback da sandbox de ~16% para menos de 2%, abordando problemas como tempos limite de uso de disco e derivação de tokens no Gateway Server.
- O treinamento utiliza PPO assimétrico com um sistema de recompensa de três níveis e Distilação Multi-Teacher On-Policy, descartando o contexto do crítico privilegiado na inferência.
O KAT-Coder-V2.5 lidera o PinchBench com uma pontuação de 94,9 e ocupa o segundo lugar no SWE-Bench Pro com 65,2, demonstrando desempenho aprimorado em tarefas de codificação agêntica.