أفاد فريق KwaiKAT في شركة Kuaishou بإصدار KAT-Coder-V2.5، وهو نموذج برمجة مصمم للعمل ضمن بيئات مستودعات حقيقية وقابلة للتنفيذ بدلاً من توليد كود لمرة واحدة. كما نشر الفريق نسخة ذات أوزان مفتوحة، وهي KAT-Coder-V2.5-Dev، على منصة Hugging Face بموجب رخصة Apache-2.0.

  • يبني AutoBuilder أزواج مهام قابلة للتحقق (الوصف، البيئة، الاختبارات) من طلبات السحب الحقيقية، مما يرفع معدلات نجاح بناء البيئة من 16.5% إلى 57.2%.
  • تتضمن المجموعة الناتجة أكثر من 100,000 بيئة قابلة للتحقق تمتد عبر 12 لغة، مع إزالة سجل git وبيانات التعريف الخاصة بالالتزامات لمنع تسرب الحلول.
  • تقوم عجلة تكبير البيانات بفلترة المسارات بناءً على جودة العملية بدلاً من نجاح الاختبار النهائي فقط، باستخدام تلميحات مستهدفة للحالات القريبة من النجاح وبوابات قائمة على القواعد للعمليات الناجحة.
  • أدت إصلاحات البنية التحتية إلى تقليل أخطاء ملاحظات الصندوق الرمزي من حوالي 16% إلى أقل من 2%، مما يعالج مشكلات مثل مهلات استخدام القرص والانحراف في الرموز الخادمية في Gateway Server.
  • يعتمد التدريب على PPO غير المتماثل مع نظام مكافآت ثلاثي المستويات وتقطيع متعدد المعلمين في السياسة، مع التخلي عن سياق الناقد المميز أثناء الاستدلال.

يتصدر KAT-Coder-V2.5 قائمة PinchBench بنتيجة 94.9 ويحتل المرتبة الثانية على SWE-Bench Pro بنتيجة 65.2، مما يُظهر أداءً محسناً في مهام البرمجة الوكيلة.