O benchmark AA foi atualizado para refletir o desempenho mais recente dos modelos de linguagem de ponta. A atualização inclui dados de teste recentes para modelos de primeira linha.

  • Flash-next é relatado como superando 3.5 max nos novos rankings.
  • Gemini 3.1 pro é notado como estando significativamente atrás dos outros concorrentes.

O artigo destaca essas mudanças no cenário competitivo entre os principais modelos de IA.