GLM-5.3はSlopCodeBenchベンチマークで30点中10点(33.3%)を獲得し、6問のサブセットでFable 5およびGPT-5.6 Solと並んだ。
- Opus 5レポートの3問、17チェックポイントリストでは、GLM-5.3は8/17(47.1%)を獲得した。
- このベンチマークは、既存の機能を壊さずに新しい要件を処理しながら、ツールを段階的に構築することを要求する。
- 現在までに、どのAIもベンチマークの完全な解決には至っていない。
- 難易度は問題を解決するために必要なトークン出力と相関しているようだ。
結果は、GLM-5.3が複雑で進化し続けるコーディングタスクにおいて他の主要モデルに対して競争力のあるパフォーマンスを示していることを示唆している。