AnthropicはClaude Code向けの新しい評価ツールをリリースし、開発者が評価の構築、グラダーの確認、それらに基づいてアプリケーションを改善するのに役立つ`build_eval`および`hill-climb`コマンドを搭載した`claude-api`プラグインを導入しました。

  • ツールは会話のトレース内の問題(人間の引き継ぎ、フォーマット、音声エージェントの問題など)を自動的に発見します。
  • 特定の失敗モードに対する評価者を作成できますが、レビュアーは初期の範囲が大きすぎると指摘しています。
  • ワークフローにはグラダーを確認し、評価結果に基づいてアプリケーションのパフォーマンスを反復的に改善するためのコマンドが含まれています。

レビューの著者は、評価者にコミットする前にデータ探索をよりよくサポートするまでツールの使用を見合わせることを提案しており、ラベルの確認用の現在のインターフェースが扱いにくいと指摘しています。