GLM-5.3 meraih skor 10 dari 30 (33,3%) pada benchmark SlopCodeBench, seri dengan Fable 5 dan GPT-5.6 Sol dalam subset enam masalah.

  • Pada daftar tiga masalah, 17 checkpoint dari laporan Opus 5, GLM-5.3 mencetak 8/17 (47,1%).
  • Benchmark ini memerlukan pembangunan alat langkah demi langkah sambil menangani persyaratan baru tanpa merusak fungsionalitas yang ada.
  • Belum ada AI yang berhasil menyelesaikan benchmark secara lengkap.
  • Tingkat kesulitan tampaknya berkorelasi dengan output token yang diperlukan untuk menyelesaikan masalah.

Hasil-hasil tersebut menunjukkan kinerja kompetitif GLM-5.3 dibandingkan dengan model-model terkemuka lainnya dalam tugas pemrograman yang kompleks dan berkembang.