يحقق Kimi K3، وهو نموذج ذو أوزان مفتوحة من Moonshot AI، أداءً مماثلاً لـ Claude Fable 5 من Anthropic على معيار DeepSWE بينما تكلفته أقل بكثير لكل مهمة. في تقييم بتاريخ 16 يوليو 2026، وصل Kimi K3 إلى نسبة نجاح 68.5% في pass@1 مقارنة بـ 69.9% لـ Fable 5، لكنه تفوق عليه في السيناريوهات متعددة المحاولات وقدم كفاءة تكلفة أعلى.

  • تبلغ تكلفة Kimi K3 4.65 دولار لكل جولة تشغيل مقابل 13.41 دولار لـ Claude Fable 5، مما يوفر 2.8 مرة أكثر من المهام المحلولة لكل دولار.
  • بينما يتفوق Fable 5 في موثوقية المحاولة الواحدة (69.9% مقابل 68.5%)، يفوز Kimi K3 في pass@2 (82.0% مقابل 80.2%) وpass@4 (89.4% مقابل 88.5%).
  • يغطي Kimi K3 نطاقاً أوسع من المهام، حيث حلل 101 مهمة فريدة مقارنة بـ 107 لـ Fable 5، مع أداء قوي في لعبة Go.
  • تُظهر النماذج ارتباطاً عالياً (0.72) وأنماط فشل متشابهة، مما يعني أنها لا توفر تنوعاً كبيراً عند دمجها.

يُصنف Kimi K3 كخيار افتراضي منطقي لأعمال الوكلاء عالية الحجم أو التي تتحمل إعادة المحاولة بسبب طبيعته ذات الأوزان المفتوحة وتكلفته الأقل، على الرغم من التفوق الطفيف لـ Fable 5 في موثوقية المحاولة الواحدة.