تفيد المقالة بأن Kimi K3 (max) يتفوق على Sonnet 5 في معيار Simple Bench.
- حقق Kimi K3 (max) نتيجة أعلى من Sonnet 5 في هذا التقييم المحدد.
تفيد المقالة بأن Kimi K3 (max) يتفوق على Sonnet 5 في معيار Simple Bench.
قارنت دراسة نظام الذكاء الاصطناعي السريري Doctorina مع ثمانية أطباء وأربعة نماذج لغوية حدودية مستقلة عبر 150 استشارة رعاية أولية بولندية اصطناعية.
قام مستخدم بتقييم Kimi K3 مقابل Claude Opus 4.8 من خلال تشغيل 34 طلبًا للنمذجة الواحدة وتقييم HTML ولقطات الشاشة وملفات GIF الناتجة باستخدام Sonnet 4.6. خلص التقييم إلى أن Kimi K3 أنتج نتائج أفضل من Opus 4.8.
يحقق Kimi K3، وهو نموذج ذو أوزان مفتوحة من Moonshot AI، أداءً مماثلاً لـ Claude Fable 5 من Anthropic على معيار DeepSWE بينما تكلفته أقل بكثير لكل مهمة. في تقييم بتاريخ 16 يوليو 2026، وصل Kimi K3 إلى نسبة نجاح 68.5% في pass@1 مقارنة بـ 69.9% لـ Fable 5، لكنه تفوق عليه في السيناريوهات متعددة المحاولات وقدم كفاءة تكلفة أعلى.
وفقًا لجدول المتصدرين لساحة الوكلاء، فإن كيمي ك3 يؤدي بمستوى مماثل لأوبوس في المهام غير المرئية. بينما يلاحظ بعض المستخدمين أن أوبوس قد يتمتع بميزة في القدرات البصرية، يشير التصنيف إلى التكافؤ لحالات الاستخدام الأخرى.
حقق كيمي ك3 المركز الأول في تقييم سبريدشيتبينش 2 من آفتركويري. يضعه هذا النتيجة في المقدمة على كلود فابل 5 في هذا المعيار المحدد.
نستخدم ملفات تعريف الارتباط لقياس الزيارات وتحسين الموقع. يمكنك قبول أو رفض ملفات تعريف الارتباط الخاصة بالتحليلات. سياسة الخصوصية