Anthropic telah mengumumkan model Claude 3.5 Sonnet yang ditingkatkan, model ringan baru bernama Claude 3.5 Haiku, serta rilis beta publik kemampuan "penggunaan komputer" untuk pengembang.
- Claude 3.5 Sonnet yang ditingkatkan meningkatkan skor SWE-bench Verified dari 33,4% menjadi 49,0% dan skor TAU-bench di domain ritel dan penerbangan, sambil mempertahankan harga dan kecepatan yang sama dengan pendahulunya.
- Claude 3.5 Haiku menyamai atau melampaui Claude 3 Opus pada banyak benchmark kecerdasan dengan kecepatan serupa dengan generasi Haiku sebelumnya, dengan harga ditetapkan sebesar $0,80 per juta token input dan $4 per juta token output.
- Penggunaan komputer memungkinkan Claude berinteraksi dengan antarmuka komputer dengan melihat layar dan mengeksekusi perintah seperti klik dan mengetik; ia mencetak skor 14,9% pada tugas OSWorld hanya screenshot, mengungguli sistem terbaik berikutnya yang mencapai 7,8%.
- Model-model baru tersedia melalui Anthropic API, Amazon Bedrock, dan Vertex AI dari Google Cloud, dengan penggunaan komputer saat ini dalam tahap beta publik eksperimental untuk umpan balik pengembang.