Anthropic telah merilis Claude Opus 5, sebuah model frontier baru yang memicu diskusi signifikan mengenai skor benchmark dan kinerja praktis. Evaluasi independen dari Epoch AI melaporkan Epoch Capabilities Index (ECI) sebesar 159 dan SWE-ECI sebesar 161 untuk model baru ini.

  • Claude Opus 5 mencapai ECI 159, sedikit di bawah skor Fable 5 yang sebesar 161.
  • Model ini menyamai Fable 5 pada benchmark rekayasa perangkat lunak dengan SWE-ECI 161.
  • Umpan balik komunitas menunjukkan bahwa skor ECI meremehkan peningkatan praktis Opus 5 dibandingkan Opus 4.8, yang hanya memiliki skor lebih rendah satu poin.
  • Beberapa evaluator mencatat kinerja non-monotonik pada FrontierCode, di mana input usaha menengah mengungguli input usaha tinggi.
  • Nous Portal telah menyediakan model ini dengan diskon 20% untuk semua model.

Peluncuran ini menyoroti perdebatan berkelanjutan mengenai sensitivitas metrik evaluasi saat ini dan kesenjangan antara skor agregat dan kemampuan agen pemrograman dunia nyata.