A Anthropic lançou o modelo Claude Opus 5, desencadeando escrutínio sobre seu desempenho em métricas de codificação e capacidade geral, além de reacender o debate sobre a avaliação de modelos de fronteira.
- A Epoch AI relatou que o Claude Opus 5 alcança um ECI de 159, ligeiramente abaixo do Fable 5 com 161, enquanto iguala o Fable 5 com um SWE-ECI de 161 em benchmarks de engenharia de software.
- Usuários criticaram a pontuação ECI por subestimar melhorias práticas, observando que é apenas um ponto superior à do Opus 4.8 apesar dos ganhos qualitativos percebidos.
- Foi notada uma irregularidade na avaliação onde o Opus 5 obteve melhor pontuação no FrontierCode com esforço médio do que com esforço alto, sugerindo ganhos não monotônicos a partir de computação adicional no tempo de inferência.
- O CTO da Microsoft, Kevin Scott, relatou uma vitória em confronto direto contra o Fable usando amostragem "best-of-n", enquanto o Nous Portal anunciou acesso ao modelo com desconto de 20%.
O lançamento destaca a tensão entre pontuações agregadas de benchmarks e desempenho relatado por usuários em tarefas agênticas como automação de navegador.