Anthropic telah merilis Claude 3.7 Sonnet, sebuah model yang dirancang untuk kasus penggunaan bisnis dan pengembang dunia nyata, bukan hanya optimasi benchmark. Rilis ini memperkenalkan kemampuan untuk beralih secara dinamis antara mode penalaran standar dan lanjutan, memungkinkan pengguna mengontrol jumlah token yang dialokasikan untuk "waktu berpikir."
- Harga ditetapkan di $3/M input token dan $15/M output token, memposisikannya di antara OpenAI's o1 dan DeepSeek R1.
- Model ini memiliki arsitektur hibrida yang menawarkan latensi ~200 ms dalam mode standar dan hingga 15 detik dalam mode berpikir diperpanjang.
- Benchmark menunjukkan kinerja kuat dalam penalaran tingkat pascasarjana (GPQA Diamond: 78,2% / 84,8%) dan pemrograman (SWE-bench: 62,3% / 70,3%), meskipun kesulitan dengan skor kompetisi matematika sekolah menengah.
- Evaluasi independen menunjukkan bahwa tidak ada model yang diuji, termasuk Claude 3.7 Sonnet, dapat diandalkan untuk masalah matematika kompleks, dengan semua mendapat skor sekitar tingkat lemparan koin pada pertanyaan gaya SAT.
Kontrol latensi dan anggaran token yang dapat dikonfigurasi memberikan fleksibilitas kepada pengembang untuk menyeimbangkan kecepatan dan akurasi tanpa memerlukan model terpisah untuk tugas yang berbeda.