Anthropic a publié de nouveaux outils d'évaluation pour Claude Code, introduisant un plugin `claude-api` avec les commandes `build_eval` et `hill-climb` conçues pour aider les développeurs à construire des évaluations, vérifier les classificateurs et améliorer les applications en conséquence.
- L'outil découvre automatiquement les problèmes dans les traces de conversation, tels que les problèmes de transfert humain, de formatage et d'agents vocaux.
- Il permet aux utilisateurs de créer des évaluateurs pour des modes de défaillance spécifiques, bien que le réviseur ait noté que la portée initiale était trop large.
- Le flux de travail comprend des commandes pour vérifier les classificateurs et améliorer itérativement les performances de l'application sur la base des résultats d'évaluation.
L'auteur de la critique suggère d'attendre que l'outil prenne mieux en charge l'exploration des données avant de s'engager dans un évaluateur, notant que l'interface actuelle pour examiner les étiquettes est fastidieuse.