أطلقت Anthropic أدوات تقييم جديدة لـ Claude Code، مقدمةً إضافة `claude-api` مع أوامر `build_eval` و `hill-climb` المصممة لمساعدة المطورين على بناء التقييمات، وفحص المقيِّمين، وتحسين التطبيقات بناءً عليها.
- يكتشف الأداة تلقائيًا المشكلات في مسارات المحادثة، مثل مشاكل التسليم البشري، والتنسيق، ووكلاء الصوت.
- يسمح للمستخدمين بإنشاء مقيِّمين لأنماط الفشل المحددة، على الرغم من أن المراجع لاحظ أن النطاق الأولي كان واسعًا جدًا.
- يتضمن سير العمل أوامر لفحص المقيِّمين وتحسين أداء التطبيق تكراريًا بناءً على نتائج التقييم.
يقترح كاتب المراجعة الانتظار قبل استخدام الأداة حتى تدعم استكشاف البيانات بشكل أفضل قبل الالتزام بمقيِّم، مشيرًا إلى أن الواجهة الحالية لمراجعة العلامات معقدة.