Команда KwaiKAT в Kuaishou выпустила KAT-Coder-V2.5, модель для написания кода, предназначенную для работы в реальных исполняемых средах репозиториев, а не для генерации одношагового кода. Команда также опубликовала вариант с открытыми весами KAT-Coder-V2.5-Dev на Hugging Face под лицензией Apache-2.0.

  • AutoBuilder формирует проверяемые тройки задач (описание, среда, тесты) из реальных pull requests, повышая успешность построения среды с 16,5% до 57,2%.
  • Полученный набор данных включает более 100 000 проверяемых сред, охватывающих 12 языков, при этом история git и метаданные коммитов удалены для предотвращения утечки решений.
  • Механизм масштабирования данных фильтрует траектории по качеству процесса, а не только по успешности финального теста, используя целевые подсказки для почти успешных попыток и правила для проходящих запусков.
  • Исправления инфраструктуры снизили количество ошибок обратной связи песочницы с ~16% до менее чем 2%, устранив такие проблемы, как таймауты использования дискового пространства и дрейф токенов на Gateway Server.
  • Обучение использует асимметричный PPO с трехуровневой системой вознаграждения и Multi-Teacher On-Policy Distillation, отбрасывая контекст привилегированного критика во время вывода.

KAT-Coder-V2.5 лидирует в PinchBench со счетом 94,9 и занимает второе место в SWE-Bench Pro со счетом 65,2, демонстрируя улучшенную производительность в задачах агентного программирования.