Claude Opus 5 secara substansial lebih kuat daripada Claude Opus 4.8 di semua aspek, dengan peningkatan terbesar dalam agentic coding, computer use, dan knowledge work jangka panjang. Model ini menetapkan state-of-the-art baru pada beberapa benchmark pihak ketiga dan sebanding atau unggul dari Claude Fable 5 serta Claude Mythos 5 pada banyak evaluasi.
- Opus 5 dipasarkan sebagai setara atau lebih baik daripada Fable 5 pada tugas praktis, sambil berjalan lebih cepat dan berharga setengah kali lipat.
- Model ini sengaja menghindari pelatihan pada tugas terkait siber, sehingga ia tidak memiliki kemampuan penuh untuk serangan siber kompleks yang ditemukan pada model kelas Mythos.
- Pada evaluasi virologi, Opus 5 terlihat sedikit lebih baik daripada Mythos 5, karena tugas-tugas ini melibatkan langkah-langkah individual alih-alih memerlukan penalaran skala besar.
- ArtificialAnalysis menilai Opus 5 pada rekor tertinggi baru sebesar 61, dan estimasi titik ECI Anthropic adalah 162.1, menempatkannya pada tren Mythos.
Artikel tersebut menyarankan bahwa tetap mempertahankan ukuran Opus dan menghindari pelatihan siber memberikan waktu bagi para pembela untuk mengakses alat yang lebih unggul dengan classifier yang memicu 85% lebih jarang daripada Fable.