Anthropic telah meluncurkan model Claude Opus 5, memicu tinjauan atas kinerjanya pada metrik pemrograman dan kemampuan umum serta memperbarui perdebatan seputar evaluasi model frontier.
- Epoch AI melaporkan Claude Opus 5 mencapai ECI sebesar 159, sedikit di bawah Fable 5 yang bernilai 161, sementara setara dengan Fable 5 pada SWE-ECI sebesar 161 dalam benchmark rekayasa perangkat lunak.
- Pengguna mengkritik skor ECI karena dianggap meremehkan peningkatan praktis, mencatat bahwa nilainya hanya satu poin lebih tinggi daripada Opus 4.8 meskipun terdapat peningkatan kualitatif yang terasa.
- Ditemukan ketidakrataan evaluasi di mana Opus 5 mencetak skor lebih baik pada FrontierCode dengan usaha sedang dibandingkan usaha tinggi, menunjukkan adanya peningkatan non-monoton dari komputasi tambahan saat inference.
- CTO Microsoft Kevin Scott melaporkan kemenangan dalam pertandingan langsung melawan Fable menggunakan sampling "best-of-n", sementara Nous Portal mengumumkan akses ke model tersebut dengan diskon 20%.
Peluncuran ini menyoroti ketegangan antara skor benchmark agregat dan kinerja yang dilaporkan pengguna dalam tugas agentic seperti otomatisasi browser.