Anthropicは、Claude 3 Model Cardの補遺を公開し、Claude 3.5 Sonnetについて詳述した。これは、速度とコストでClaude 3 Opusを上回り、コーディングと視覚処理において強化された機能を提供する新しいモデルである。

  • Claude 3.5 Sonnetは、大学院レベルの科学(GPQA)、一般的な推論(MMLU)、およびコーディング能力(HumanEval)で新たなパフォーマンス基準を確立した。
  • MathVista、ChartQA、DocVQAを含む5つのビジョンベンチマークで最先端の結果を達成した。
  • 内部のエージェント型コーディング評価では、Claude 3 Opusの38%に対して64%の問題を解決した。
  • 人間のフィードバックによる評価では、コーディング、ドキュメント、クリエイティブライティングなどのコア機能においてClaude 3 Opusに対して大幅な勝率を示した。
  • 補遺はまた、WildchatおよびXSTestデータセットでの拒否率の改善と、200kトークンまでのNeedle In A Haystackテストにおけるほぼ完璧な recall を報告している。