حقق كيمي ك3 المركز الأول في تقييم سبريدشيتبينش 2 من آفتركويري. يضعه هذا النتيجة في المقدمة على كلود فابل 5 في هذا المعيار المحدد.
كيمي ك3 يحتل المرتبة الأولى في سبريدشيتبينش 2 من آفتركويري، متجاوزاً كلود فابل 5
تتفوق Doctorina على الأطباء في التشخيص الاصطناعي للرعاية الأولية البولندي
قارنت دراسة نظام الذكاء الاصطناعي السريري Doctorina مع ثمانية أطباء وأربعة نماذج لغوية حدودية مستقلة عبر 150 استشارة رعاية أولية بولندية اصطناعية.
كيمي كيه 3 يتفوق على أوبوس 4.8 في توليد HTML بنموذج واحد
قام مستخدم بتقييم Kimi K3 مقابل Claude Opus 4.8 من خلال تشغيل 34 طلبًا للنمذجة الواحدة وتقييم HTML ولقطات الشاشة وملفات GIF الناتجة باستخدام Sonnet 4.6. خلص التقييم إلى أن Kimi K3 أنتج نتائج أفضل من Opus 4.8.
يُطابق Kimi K3 أداء Claude Fable 5 على DeepSWE بتكلفة ثلث التكلفة
يحقق Kimi K3، وهو نموذج ذو أوزان مفتوحة من Moonshot AI، أداءً مماثلاً لـ Claude Fable 5 من Anthropic على معيار DeepSWE بينما تكلفته أقل بكثير لكل مهمة. في تقييم بتاريخ 16 يوليو 2026، وصل Kimi K3 إلى نسبة نجاح 68.5% في pass@1 مقارنة بـ 69.9% لـ Fable 5، لكنه تفوق عليه في السيناريوهات متعددة المحاولات وقدم كفاءة تكلفة أعلى.
كيمي ك3 يصنف بنفس مستوى أوبوس في التفكير على ساحة الوكلاء
وفقًا لجدول المتصدرين لساحة الوكلاء، فإن كيمي ك3 يؤدي بمستوى مماثل لأوبوس في المهام غير المرئية. بينما يلاحظ بعض المستخدمين أن أوبوس قد يتمتع بميزة في القدرات البصرية، يشير التصنيف إلى التكافؤ لحالات الاستخدام الأخرى.
Kimi K3 (max) يتفوق على Sonnet 5 في Simple Bench
تفيد المقالة بأن Kimi K3 (max) يتفوق على Sonnet 5 في معيار Simple Bench.