A Anthropic lançou o Claude Opus 5, um novo modelo de fronteira que gerou discussões significativas sobre pontuações em benchmarks e desempenho prático. Avaliações independentes da Epoch AI reportam um Índice de Capacidades da Epoch (ECI) de 159 e um SWE-ECI de 161 para o novo modelo.

  • O Claude Opus 5 alcança um ECI de 159, ligeiramente abaixo da pontuação do Fable 5, que é 161.
  • O modelo iguala o Fable 5 nos benchmarks de engenharia de software com um SWE-ECI de 161.
  • O feedback da comunidade sugere que a pontuação do ECI subestima as melhorias práticas do Opus 5 em relação ao Opus 4.8, que marcou apenas um ponto a menos.
  • Alguns avaliadores notaram desempenho não monotônico no FrontierCode, onde entradas de esforço médio superaram as de alto esforço.
  • O Nous Portal disponibilizou o modelo com um desconto de 20% em todos os modelos.

O lançamento destaca os debates contínuos sobre a sensibilidade das métricas de avaliação atuais e a lacuna entre pontuações agregadas e as capacidades reais de agentes de codificação no mundo real.