O benchmark AA foi atualizado para refletir o desempenho mais recente dos modelos de linguagem de ponta. A atualização inclui dados de teste recentes para modelos de primeira linha.
- Flash-next é relatado como superando 3.5 max nos novos rankings.
- Gemini 3.1 pro é notado como estando significativamente atrás dos outros concorrentes.
O artigo destaca essas mudanças no cenário competitivo entre os principais modelos de IA.