O Terminal Bench 4.0 foi lançado, atualizando o benchmark para acompanhar os novos lançamentos de modelos e combater a saturação do benchmark.

  • A atualização inclui dados de desempenho mostrando que o GLM-5.3 está no mesmo nível do Fable 5, considerando a margem de erro.
  • O anúncio enfatiza a rápida iteração no TerminalBench para manter a relevância contra modelos emergentes.
  • A discussão da comunidade destaca o alto custo computacional de benchmarks grandes, observando que eles exigem 5-10B tokens por execução.