쿠아이쇼우의 KwaiKAT 팀은 단일 턴 코드 생성이 아닌 실제 실행 가능한 저장소 환경 내에서 작동하도록 설계된 코딩 모델인 KAT-Coder-V2.5를 출시했습니다. 또한 팀은 Apache-2.0 라이선스 하에 Hugging Face에 오픈 웨이트 변형 버전인 KAT-Coder-V2.5-Dev를 공개했습니다.
- AutoBuilder는 실제 풀 리퀘스트에서 검증 가능한 작업 삼중주(설명, 환경, 테스트)를 구성하여 환경 구축 성공률을 16.5%에서 57.2%로 높였습니다.
- 결과 데이터셋에는 12개 언어에 걸쳐 100,000개 이상의 검증 가능한 환경이 포함되어 있으며, 솔루션 유출을 방지하기 위해 git 기록과 커밋 메타데이터가 제거되었습니다.
- 데이터 확장 날개바퀴는 최종 테스트 성공 여부뿐만 아니라 프로세스 품질에 따라 궤적을 필터링하며, 근접 실패 사례에는 타겟 힌트를, 통과 사례에는 규칙 기반 게이트를 사용합니다.
- 인프라 수정으로 샌드박스 피드백 오류가 약 16%에서 2% 미만으로 감소했으며, 이는 디스크 사용량 시간 초과 및 Gateway Server의 토큰 드리프트와 같은 문제를 해결한 것입니다.
- 훈련은 비대칭 PPO와 3단계 보상 시스템, Multi-Teacher On-Policy Distillation을 활용하며, 추론 시 프라이빌리지 크리틱 컨텍스트를 폐기합니다.
KAT-Coder-V2.5는 PinchBench에서 94.9점으로 선두를 차지하고 있으며, SWE-Bench Pro에서는 65.2점으로 2위를 기록하여 에이전트 코딩 작업에서 향상된 성능을 입증했습니다.