Anthropic melaporkan bahwa model Claude 3.5 Sonnet yang ditingkatkan mereka meraih skor 49% pada benchmark SWE-bench Verified, melampaui skor state-of-the-art sebelumnya sebesar 45%. Artikel tersebut merinci sistem "agen" yang dibangun di sekitar model untuk membantu pengembang mengoptimalkan kinerja.
- SWE-bench Verified adalah subset dari 500 tugas teknik perangkat lunak yang ditinjau yang menguji kemampuan model dalam menyelesaikan isu GitHub di repositori Python.
- Filosofi desain agen memprioritaskan pemberian kontrol ke model bahasa dengan scaffolding minimal, menggunakan alat Bash dan Edit.
- Deskripsi alat disempurnakan untuk mencegah kesalahpahaman, seperti mewajibkan path absolut untuk menghindari kesalahan saat memindahkan direktori.
- Sistem melakukan sampling hingga model memutuskan bahwa ia selesai atau melebihi panjang konteks 200k-nya.
Posting ini bertujuan membantu pengembang memahami arsitektur agen untuk mendapatkan kinerja terbaik dari Claude 3.5 Sonnet pada tugas-tugas pemrograman.