GLM-5.3 набрал 10 из 30 баллов (33,3%) в бенчмарке SlopCodeBench, разделив первое место с Fable 5 и GPT-5.6 Sol в подмножестве из шести задач.
- На списке из трех задач и 17 контрольных точек из отчета Opus 5 GLM-5.3 набрал 8/17 (47,1%).
- Бенчмарк требует пошагового создания инструментов при обработке новых требований без нарушения существующей функциональности.
- Ни одна ИИ-система еще не достигла полного решения бенчмарка.
- Сложность, по-видимому, коррелирует с количеством токенов, необходимых для решения задач.
Результаты указывают на конкурентоспособность GLM-5.3 по сравнению с другими ведущими моделями в сложных, эволюционирующих задачах программирования.