A Anthropic lançou novas ferramentas de avaliação para o Claude Code, introduzindo um plugin `claude-api` com comandos `build_eval` e `hill-climb` projetados para ajudar desenvolvedores a construir avaliações, verificar classificadores e melhorar aplicativos com base nelas.
- A ferramenta descobre automaticamente problemas em rastros de conversa, como problemas com transferência humana, formatação e agentes de voz.
- Permite que os usuários criem avaliadores para modos de falha específicos, embora o revisor tenha notado que o escopo inicial era muito amplo.
- O fluxo de trabalho inclui comandos para verificar classificadores e melhorar iterativamente o desempenho do aplicativo com base nos resultados da avaliação.
O autor da revisão sugere adiar o uso da ferramenta até que ela suporte melhor a exploração de dados antes de se comprometer com um avaliador, observando que a interface atual para revisar rótulos é complicada.