快手のKwaiKATチームは、単発のコード生成ではなく、実際の実行可能なリポジトリ環境内で動作するように設計されたコーディングモデル「KAT-Coder-V2.5」をリリースしました。また、同チームはApache-2.0ライセンスの下で、Hugging Faceにオープンウェイト版「KAT-Coder-V2.5-Dev」も公開しています。
- AutoBuilderは、実際のプルリクエストから検証可能なタスクのトリプレット(説明、環境、テスト)を構築し、環境構築の成功率を16.5%から57.2%に向上させました。
- 生成されたデータセットには、12言語にわたる10万件以上の検証可能な環境が含まれており、ソリューションの漏洩を防ぐためにgit履歴とコミットメタデータが削除されています。
- データのスケーリング・フライホイールは、最終的なテストの成功だけでなくプロセスの品質に基づいて軌道をフィルタリングし、惜敗したケースにはターゲットを絞ったヒントを提供し、合格したランにはルールベースのゲートを使用します。
- インフラストラクチャの修正により、サンドボックスフィードバックエラーが約16%から2%未満に減少し、ディスク使用量のタイムアウトやGateway Serverでのトークンドリフトなどの問題に対処しました。
- 学習には、3段階の報酬システムとMulti-Teacher On-Policy Distillationを用いた非対称PPOを採用し、推論時には特権的な批評家のコンテキストを破棄しています。
KAT-Coder-V2.5はPinchBenchで94.9点のスコアを獲得し首位となり、SWE-Bench Proでは65.2点で2位につけ、エージェント型コーディングタスクにおけるパフォーマンスの向上を示しました。