DeepSWE 벤치마크에서의 GLM-5.3과 Claude Fable 5 비교 분석 결과, 두 모델 모두 첫 시도 정확도(69.0% 대 69.7%)에서 거의 동일한 성능을 보였으나, GLM-5.3은 비용 효율성이 현저히 높고 다중 시도 시나리오에서도 더 우수한 성능을 보였다.
- GLM-5.3의 라운드당 비용은 $3.99로 Fable 5의 $21.63보다 낮으며, 이는 5.4배의 가격 차이를 만들어 $100당 17회 해결(반면 Fable은 3회)을 가능하게 한다.
- 다중 시도 지표에서 GLM-5.3은 pass@2가 81.1%(대 77.1%), pass@4가 87.6%(대 84.1%)로 선두를 차지하며 더 높은 상한선을 보여준다.
- 두 모델은 작업당 상관관계가 0.65인 근접 대체재이므로, 둘 다 실행해도 커버리지 다양성은 거의 추가되지 않는다.
- GLM-5.3은 동시성 및 내구성 포함 5개 작업 도메인에서 승리했으며, Fable 5는 Rust(85% 대 70%)와 직렬화 중심 작업에서만 우위를 점한다.
분석 결과에 따르면 GLM-5.3은 낮은 비용과 더 넓은 커버리지로 인해 대부분의 소프트웨어 공학 작업의 기본 모델이 되어야 하며, Fable 5는 Rust 또는 직렬화 중시 작업에 한정된 비싼 확장 경로로 남겨두어야 한다.