تصدر كيمى K3 قائمة المتصدرين الجديدة لـ FullStack على arena.ai.
حقق النموذج الموضع الأول في هذا المعيار الجديد الذي تم تقديمه مؤخرًا.
تصدر كيمى K3 قائمة المتصدرين الجديدة لـ FullStack على arena.ai.
حقق النموذج الموضع الأول في هذا المعيار الجديد الذي تم تقديمه مؤخرًا.
قام مستخدم بتقييم Kimi K3 مقابل Claude Opus 4.8 من خلال تشغيل 34 طلبًا للنمذجة الواحدة وتقييم HTML ولقطات الشاشة وملفات GIF الناتجة باستخدام Sonnet 4.6. خلص التقييم إلى أن Kimi K3 أنتج نتائج أفضل من Opus 4.8.
تكشف مقارنة بين كيمي K3 وجي بي تي-5.6 سول على معيار DeepSWE أنه بينما يتصدر جي بي تي-5.6 سول في جودة المحاولة الواحدة (72.7% مقابل 68.5%)، يحقق كيمي K3 نتائج أعلى في درجات pass@k لـ k > 1 بتكلفة أقل بكثير.
يحقق Kimi K3، وهو نموذج ذو أوزان مفتوحة من Moonshot AI، أداءً مماثلاً لـ Claude Fable 5 من Anthropic على معيار DeepSWE بينما تكلفته أقل بكثير لكل مهمة. في تقييم بتاريخ 16 يوليو 2026، وصل Kimi K3 إلى نسبة نجاح 68.5% في pass@1 مقارنة بـ 69.9% لـ Fable 5، لكنه تفوق عليه في السيناريوهات متعددة المحاولات وقدم كفاءة تكلفة أعلى.
وفقًا لـ Artificial Analysis، أدى إصدار Kimi-K3 إلى تقليل الفارق الزمني بين حدود الذكاء الاصطناعي ذات المصدر المفتوح والمغلق إلى 1.5 شهر فقط.
وفقًا لجدول المتصدرين لساحة الوكلاء، فإن كيمي ك3 يؤدي بمستوى مماثل لأوبوس في المهام غير المرئية. بينما يلاحظ بعض المستخدمين أن أوبوس قد يتمتع بميزة في القدرات البصرية، يشير التصنيف إلى التكافؤ لحالات الاستخدام الأخرى.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية