O Terminal Bench 4.0 foi lançado, atualizando o benchmark para acompanhar os novos lançamentos de modelos e combater a saturação do benchmark.
- A atualização inclui dados de desempenho mostrando que o GLM-5.3 está no mesmo nível do Fable 5, considerando a margem de erro.
- O anúncio enfatiza a rápida iteração no TerminalBench para manter a relevância contra modelos emergentes.
- A discussão da comunidade destaca o alto custo computacional de benchmarks grandes, observando que eles exigem 5-10B tokens por execução.