Claude Opus 5は、全般的にClaude Opus 4.8よりも大幅に強力であり、エージェント型コーディング、コンピュータ操作、長期の知識作業において最大の向上が見られる。複数の第三者ベンチマークで新たなSOTAを樹立し、多くの評価においてClaude Fable 5やClaude Mythos 5と同等かそれ以上である。
- Opus 5は、実用的なタスクにおいてFable 5と同等またはそれ以上に優れており、さらに高速でコストは半分であると位置づけられている。
- このモデルは意図的にサイバー関連のタスクでの学習を回避しており、Mythosクラスモデルに見られるような複雑なサイバー攻撃の全能力を欠いている。
- ウイルス学評価では、Opus 5がMythos 5よりもわずかに優れているように見える。これらのタスクは大規模な推論を必要とせず、個別のステップに関わるためである。
- ArtificialAnalysisはOpus 5を61という過去最高のスコアで評価し、Anthropic ECIの点推定値は162.1であり、Mythosのトレンドライン上に位置している。
記事では、Opusサイズのモデルを維持しサイバー学習を回避することで、防御側がFableよりも85%少ない頻度でトリガーする分類器を持つより優れたツールにアクセスするための時間を確保できると示唆されている。