DeepSWE 벤치마크에서 GLM-5.3과 그 증류된 변형인 GLM-5.3 Flash를 비교한 결과, 증류가 핵심 코딩 능력을 유지하면서 롤아웃 비용을 크게 줄였음이 드러났다. 전체 모델은 작업당 $3.99에 69.0%의 pass@1률을 달성하는 반면, Flash 변형은 단 $0.24에 63.4%를 기록하여 17배의 가격 절감을 나타낸다.
- 품질 격차는 pass@1에서 5.6점에서 pass@4에서 2.6점(87.6% 대 85.0%)으로 좁아져, 손실이 주로 능력보다는 신뢰성 문제임을 시사한다.
- GLM-5.3 Flash는 전체 모델의 $3.99에 비해 롤아웃당 $0.24가 소요되어, $100당 17개 대신 264개의 작업을 해결한다.
- Flash 변형은 불안정한 작업에서 추가 노력을 성공으로 전환하는 능력을 잃어, 통과한 실행이 전체 모델의 61%에 비해 46%의 경우에서만 더 많은 단계를 필요로 했다.
- 증류는 성능 프로필을 재구성하여 동시성, Python, 데이터 모델링 분야에서 입지를 다지는 대신 JavaScript와 쿼리 중심 작업을 양도했다.
- 주목할 만한 후퇴는 주의력 감소로, Flash는 전체 모델의 4.4%에 비해 롤아웃의 6.9%에서 베이스라인 테스트를 깨뜨렸다.
GLM-5.3 Flash를 먼저 실행하고 거부 시에만 전체 모델로 격상하면 DeepSWE 작업의 80.9%를 각 $1.70에 해결하여, 처리량 제한 워크로드에 대한 비용 효율적인 전략을 제공한다.