Anthropic ने Claude Code के लिए नए मूल्यांकन उपकरण जारी किए हैं, `claude-api` प्लगइन को पेश करते हुए जिसमें `build_eval` और `hill-climb` कमांड शामिल हैं जो डेवलपर्स को मूल्यांकन बनाने, ग्रेडर्स की जांच करने और उनके आधार पर एप्लिकेशन को बेहतर बनाने में मदद करने के लिए डिज़ाइन किए गए हैं।
- उपकरण संवाद ट्रैस में समस्याओं को स्वचालित रूप से खोजता है, जैसे मानव हस्तांतरण, फॉर्मेटिंग और वॉइस एजेंट्स से जुड़ी समस्याएं।
- यह उपयोगकर्ताओं को विशिष्ट विफलता मोड के लिए इवैल्यूएटर्स बनाने की अनुमति देता है, हालांकि समीक्षक ने नोट किया कि प्रारंभिक स्कोप बहुत व्यापक था।
- वर्कफ़्लो में ग्रेडर्स की जांच करने और मूल्यांकन परिणामों के आधार पर एप्लिकेशन प्रदर्शन को पुनरावृत्ति से बेहतर बनाने के लिए कमांड शामिल हैं।
समीक्षा के लेखक सुझाव देते हैं कि इवैल्यूएटर को अपनाने से पहले डेटा अन्वेषण का बेहतर समर्थन होने तक उपकरण का उपयोग करने से बचना चाहिए, यह नोट करते हुए कि लेबल की समीक्षा के लिए वर्तमान इंटरफ़ेस जटिल है।