Anthropic выпустила новые инструменты оценки для Claude Code, представив плагин `claude-api` с командами `build_eval` и `hill-climb`, предназначенными для помощи разработчикам в создании оценок, проверке классификаторов и улучшении приложений на их основе.
- Инструмент автоматически обнаруживает проблемы в трассировках диалогов, такие как проблемы с передачей данных человеку, форматированием и голосовыми агентами.
- Он позволяет пользователям создавать оценщики для конкретных режимов отказов, хотя рецензент отметил, что первоначальный охват был слишком широким.
- Рабочий процесс включает команды для проверки классификаторов и итеративного улучшения производительности приложения на основе результатов оценки.
Автор рецензии предлагает воздержаться от использования инструмента до тех пор, пока он не будет лучше поддерживать исследование данных перед принятием решения об оценщике, отмечая, что текущий интерфейс для просмотра меток неудобен.