Anthropic telah merilis alat evaluasi baru untuk Claude Code, memperkenalkan plugin `claude-api` dengan perintah `build_eval` dan `hill-climb` yang dirancang untuk membantu pengembang membangun evaluasi, memeriksa grader, dan meningkatkan aplikasi berdasarkan hasilnya.
- Alat ini secara otomatis menemukan masalah dalam jejak percakapan, seperti masalah dengan alih tangan manusia, format, dan agen suara.
- Ini memungkinkan pengguna membuat evaluator untuk mode kegagalan spesifik, meskipun peninjau mencatat bahwa ruang lingkup awalnya terlalu luas.
- Alur kerja mencakup perintah untuk memeriksa grader dan meningkatkan kinerja aplikasi secara iteratif berdasarkan hasil evaluasi.
Penulis ulasan menyarankan untuk menunda penggunaan alat tersebut hingga lebih mendukung eksplorasi data sebelum berkomitmen pada evaluator, mencatat bahwa antarmuka saat ini untuk meninjau label cukup merepotkan.