وصل نموذج Claude 3.5 Sonnet المطور من Anthropic إلى نسبة 49% على معيار SWE-bench Verified، متجاوزاً النتيجة السابقة البالغة 45%. يوضح المقال نظام "الوكيل" المصمم حول النموذج لتحقيق هذه النتيجة.
- يُعد SWE-bench Verified مجموعة فرعية مكونة من 500 مهمة هندسة برمجية قابلة للحل، تُستخدم لتقييم قدرة وكيل الذكاء الاصطناعي على حل مشكلات GitHub في مستودعات Python.
- تركز فلسفة تصميم الوكيل على منح السيطرة لنموذج اللغة مع الحد الأدنى من الهيكل المساعد، باستخدام أداة Bash وأداة Edit فقط.
- يقوم النظام بأخذ عينات من الاستجابات حتى يقرر النموذج أنه انتهى أو يتجاوز طول السياق البالغ 200k.
- تم صياغة أوصاف مفصلة للأدوات لمنع سوء الفهم، مما يسمح للنموذج باختيار سير العمل الخاص به بدلاً من اتباع أنماط ثابتة مسبقاً.
يساعد هذا النهج المطورين على تحسين استخدامهم لـ Claude 3.5 Sonnet في مهام البرمجة المعقدة من خلال إظهار كيف يمكن للهيكل المساعد البسيط أن يستغل قدرات النموذج بفعالية.