أعلنت Anthropic أن نموذجها المطور Claude 3.5 Sonnet حقق نتيجة بنسبة 49% في معيار SWE-bench Verified، متجاوزاً النتيجة السابقة البالغة 45%. يوضح المقال نظام "الوكيل" المبنى حول النموذج لمساعدة المطورين على تحسين الأداء.

  • SWE-bench Verified هو مجموعة فرعية من 500 مهمة هندسة برمجية تمت مراجعتها تختبر قدرة النموذج على حل مشكلات GitHub في مستودعات Python.
  • تفضل فلسفة تصميم الوكيل إعطاء التحكم لنموذج اللغة بأقل قدر من الهياكل الداعمة، باستخدام أدوات Bash وEdit.
  • تم تحسين أوصاف الأدوات لمنع سوء الفهم، مثل مطالبة المسارات المطلقة لتجنب الأخطاء عند نقل المجلدات.
  • يقوم النظام بأخذ العينات حتى يقرر النموذج أنه انتهى أو يتجاوز طول السياق الخاص به البالغ 200k.

يهدف المنشور إلى مساعدة المطورين على فهم بنية الوكيل للحصول على أفضل أداء ممكن من Claude 3.5 Sonnet في مهام البرمجة.