Anthropic ha lanzado nuevas herramientas de evaluación para Claude Code, introduciendo un plugin `claude-api` con comandos `build_eval` y `hill-climb` diseñados para ayudar a los desarrolladores a construir evaluaciones, verificar clasificadores y mejorar aplicaciones en función de ellas.
- La herramienta descubre automáticamente problemas en las trazas de conversación, como problemas con la transferencia humana, el formato y los agentes de voz.
- Permite a los usuarios crear evaluadores para modos de fallo específicos, aunque el revisor señaló que el alcance inicial era demasiado amplio.
- El flujo de trabajo incluye comandos para verificar clasificadores y mejorar iterativamente el rendimiento de la aplicación basándose en los resultados de la evaluación.
El autor de la reseña sugiere esperar a usar la herramienta hasta que soporte mejor la exploración de datos antes de comprometerse con un evaluador, señalando que la interfaz actual para revisar las etiquetas es engorrosa.