نشرت أنثروبيك ملحقاً لبطاقة نموذج Claude يوضح تفاصيل Claude 3.5 Sonnet، وهو نموذج جديد يتفوق على Claude 3 Opus من حيث السرعة والتكلفة، مع تقديم قدرات محسّنة في البرمجة ومعالجة الصور.
- يضع Claude 3.5 Sonnet معايير أداء جديدة في العلوم المتقدمة (GPQA)، والاستدلال العام (MMLU)، والبراعة في البرمجة (HumanEval).
- يحقق نتائج رائدة على خمسة معايير للرؤية، بما في ذلك MathVista وChartQA وDocVQA.
- في تقييم برمجي داخلي يعتمد على الوكلاء، حلّ النموذج 64% من المشكلات مقارنة بـ 38% لـ Claude 3 Opus.
- أظهرت التقييمات القائمة على التغذية الراجعة البشرية معدلات فوز كبيرة مقارنة بـ Claude 3 Opus في القدرات الأساسية مثل البرمجة والمستندات والكتابة الإبداعية.
- كما يوثّق الملحق تحسّن معدلات الرفض على مجموعات بيانات Wildchat وXSTest، واسترجاعاً شبه مثالي في اختبارات Needle In A Haystack حتى 200k توكن.