DeepSWE 벤치마크에서 GLM-5.3과 GPT-5.6 Sol을 비교 분석한 결과, 캐스케이딩 라우팅 전략이 단일 모델만 사용하는 것보다 더 뛰어난 성능을 보였습니다. GLM-5.3을 먼저 실행하고 테스트가 실패할 때만 GPT-5.6 Sol로 승격시키는 방식으로 시스템을 운영하면, 작업당 $6.61의 비용으로 85.9%의 작업을 해결할 수 있습니다.

  • GLM-5.3은 라운드당 $3.99의 비용이 드는 반면, Sol은 $8.37이므로 GLM-5.3이 2.1배 저렴하며, $100당 17개의 작업을 해결하는 반면 Sol은 9개를 해결합니다.
  • GPT-5.6 Sol은 단일 샷 정확도(pass@1 기준 72.7%)와 신뢰성(4회 중 4회 모두 작업 해결)에서 선도적인 위치를 차지하며, GLM-5.3은 pass@2에서 동률을 이루고 pass@4에서 87.6%로 앞섭니다.
  • 두 모델은 작업당 상관관계가 0.43으로 크게 갈리며, 113개 중 106개의 작업을 함께 커버하여 효과적인 캐스케이드를 가능하게 합니다.
  • GLM-5.3은 더 깨끗한 실패 모드를 보여주며, 기존 테스트를 깨뜨리는 비율이 Sol의 20%에 비해 실패 사례의 11%에 불과하므로 무거운 회귀 게이트링의 필요성을 줄여줍니다.

이 접근 방식은 GLM-5.3을 저비용 프론트엔드로 사용하고 Sol을 검증자 게이트 승격으로 활용하여, Sol 단독보다 더 높은 커버리지를 달성하면서도 단일 Sol 라운드보다 저렴함을 유지합니다.