Anthropic 发布了针对 Claude Code 的新评估工具,引入了带有 `build_eval` 和 `hill-climb` 命令的 `claude-api` 插件,旨在帮助开发人员构建评估、检查评分器并据此改进应用程序。

  • 该工具会自动发现对话轨迹中的问题,例如人工交接、格式化和语音代理方面的问题。
  • 它允许用户为特定的故障模式创建评估器,尽管评论者指出初始范围过于宽泛。
  • 工作流程包括用于检查评分器的命令,并根据评估结果迭代改进应用程序性能。

评论作者建议,在承诺使用某个评估器之前,应等待该工具更好地支持数据探索,并指出当前查看标签的界面很繁琐。