快手KwaiKAT团队发布了KAT-Coder-V2.5,这是一款旨在在实际可执行仓库环境中运行的编程模型,而非仅生成单轮代码。该团队还在Hugging Face上以Apache-2.0许可证发布了开源权重变体KAT-Coder-V2.5-Dev。
- AutoBuilder从真实的拉取请求中构建可验证的任务三元组(描述、环境、测试),将环境构建成功率从16.5%提升至57.2%。
- 生成的数据集包含超过10万个可验证环境,涵盖12种编程语言,并剥离了git历史和提交元数据以防止解决方案泄露。
- 数据扩展飞轮根据过程质量而非仅最终测试成功来过滤轨迹,对接近成功的案例使用针对性提示,对通过的运行使用基于规则的关卡。
- 基础设施修复将沙箱反馈错误从约16%降低到2%以下,解决了磁盘使用超时和Gateway Server中的令牌漂移等问题。
- 训练采用非对称PPO和三阶段奖励系统以及多教师在线策略蒸馏,在推理时丢弃特权批评家上下文。
KAT-Coder-V2.5在PinchBench上以94.9分领先,在SWE-Bench Pro上以65.2分排名第二,展示了在代理编程任务中性能的提升。