GLM-5.3 在 SlopCodeBench 基准测试中取得了 30 分中的 10 分(33.3%),在六题子集中与 Fable 5 和 GPT-5.6 Sol 并列。

  • 在 Opus 5 报告中的三题、17个检查点列表中,GLM-5.3 得分为 8/17(47.1%)。
  • 该基准测试要求在逐步构建工具的同时处理新需求,且不破坏现有功能。
  • 目前尚无 AI 完全解决该基准测试。
  • 难度似乎与解决问题所需的输出 token 数量相关。

结果表明,GLM-5.3 在复杂且不断演变的编码任务中与其他领先模型具有竞争力。