AA 基准测试已更新,以反映前沿语言模型的最新性能。此次更新包含了顶级模型的最新测试数据。

  • Flash-next 据报道在新排名中优于 3.5 max。
  • Gemini 3.1 pro 被认为明显落后于其他竞争对手。

文章强调了这些领先 AI 模型之间竞争格局的变化。