Terminal Bench 4.0 telah dirilis, memperbarui benchmark untuk mengikuti rilis model baru dan memerangi saturasi benchmark.

  • Pembaruan ini mencakup data kinerja yang menunjukkan GLM-5.3 berada di level yang sama dengan Fable 5, memperhitungkan margin of error.
  • Pengumuman menekankan iterasi cepat pada TerminalBench untuk mempertahankan relevansi terhadap model yang muncul.
  • Diskusi komunitas menyoroti biaya komputasi tinggi dari benchmark besar, mencatat bahwa mereka membutuhkan 5-10B token per jalankan.