GLM-5.3은 SlopCodeBench 벤치마크에서 30점 중 10점(33.3%)을 기록하여 6문제 하위 집합에서 Fable 5 및 GPT-5.6 Sol과 동점을 기록했습니다.
- Opus 5 보고서의 3문제, 17체크포인트 목록에서 GLM-5.3은 8/17(47.1%)를 기록했습니다.
- 이 벤치마크는 기존 기능을 손상시키지 않으면서 새로운 요구사항을 처리하면서 단계별로 도구를 구축해야 합니다.
- 지금까지 어떤 AI도 벤치마크를 완전히 해결하지 못했습니다.
- 난이도는 문제를 해결하는 데 필요한 토큰 출력과 상관관계가 있는 것으로 보입니다.
이 결과는 GLM-5.3이 복잡하고 진화하는 코딩 작업에서 다른 선도적인 모델들과 경쟁력 있는 성능을 보인다는 것을 나타냅니다.