Model Claude 3.5 Sonet yang ditingkatkan oleh Anthropic mencapai skor 49% pada benchmark SWE-bench Verified, melampaui skor state-of-the-art sebelumnya sebesar 45%. Artikel ini menguraikan sistem "agen" yang dibangun di sekitar model tersebut untuk mencapai hasil ini.

  • SWE-bench Verified adalah subset dari 500 tugas teknik perangkat lunak yang dapat diselesaikan, digunakan untuk mengevaluasi kemampuan agen AI dalam menyelesaikan isu GitHub pada repositori Python.
  • Filosofi desain agen mengutamakan pemberian kendali kepada model bahasa dengan perancah minimal, menggunakan hanya Bash Tool dan Edit Tool.
  • Sistem ini mengambil sampel respons hingga model memutuskan bahwa proses selesai atau melebihi panjang konteks 200k.
  • Deskripsi alat yang mendetail dibuat untuk mencegah kesalahpahaman, memungkinkan model memilih alur kerja sendiri daripada mengikuti pola yang telah dikodekan secara keras.

Pendekatan ini membantu pengembang mengoptimalkan penggunaan Claude 3.5 Sonet untuk tugas pemrograman kompleks dengan menunjukkan bagaimana perancah minimal dapat memanfaatkan kemampuan model secara efektif.