نشرت أنثروبيك ملحقاً لبطاقة نموذج Claude يوضح تفاصيل Claude 3.5 Sonnet، وهو نموذج جديد يتفوق على Claude 3 Opus من حيث السرعة والتكلفة، مع تقديم قدرات محسّنة في البرمجة ومعالجة الصور.

  • يضع Claude 3.5 Sonnet معايير أداء جديدة في العلوم المتقدمة (GPQA)، والاستدلال العام (MMLU)، والبراعة في البرمجة (HumanEval).
  • يحقق نتائج رائدة على خمسة معايير للرؤية، بما في ذلك MathVista وChartQA وDocVQA.
  • في تقييم برمجي داخلي يعتمد على الوكلاء، حلّ النموذج 64% من المشكلات مقارنة بـ 38% لـ Claude 3 Opus.
  • أظهرت التقييمات القائمة على التغذية الراجعة البشرية معدلات فوز كبيرة مقارنة بـ Claude 3 Opus في القدرات الأساسية مثل البرمجة والمستندات والكتابة الإبداعية.
  • كما يوثّق الملحق تحسّن معدلات الرفض على مجموعات بيانات Wildchat وXSTest، واسترجاعاً شبه مثالي في اختبارات Needle In A Haystack حتى 200k توكن.