Se ha lanzado Terminal Bench 4.0, actualizando el benchmark para mantenerse al día con los nuevos lanzamientos de modelos y combatir la saturación del benchmark.

  • La actualización incluye datos de rendimiento que muestran que GLM-5.3 está al mismo nivel que Fable 5, considerando el margen de error.
  • El anuncio enfatiza la rápida iteración en TerminalBench para mantener la relevancia frente a los modelos emergentes.
  • La discusión de la comunidad destaca el alto costo computacional de los benchmarks grandes, señalando que requieren 5-10B tokens por ejecución.