DeepSWE 벤치마크에서 DeepSeek V4 Pro 0813과 GPT-5.6 Sol을 비교한 결과, 테스트 실패 시 DeepSeek를 먼저 실행하고 GPT-5.6 Sol로 승격하는 방식이 작업당 $3.35의 비용으로 83.0%의 성공률을 달성함을 보여줍니다.

  • DeepSeek V4 Pro 0813은 롤아웃당 $0.24의 비용이 들며, 이는 GPT-5.6 Sol의 $8.37 가격표보다 35배 저렴합니다.
  • GPT-5.6 Sol은 72.7%의 pass@1 비율로 단일 시도 정확도에서 우위를 점하지만, DeepSeek V4 Pro 0813은 네 번의 시도로 88.5%의 pass@4 점수로 이를 뛰어넘습니다.
  • 이 연쇄 전략은 두 모델을 단독으로 실행하는 것보다 우수하며, GPT-5.6 Sol의 작업당 비용의 절반 미만으로 83.0%의 커버리지를 달성하여 완벽한 원샷 오라클 라우터보다도 더 나은 성능을 보입니다.
  • GPT-5.6 Sol은 지연 시간 민감형 작업에서 여전히 우위를 점하며, DeepSeek의 35분 대비 17분에 롤아웃을 완료하고 Python과 Go를 포함한 여덟 가지 작업 도메인 중 여섯 가지를 정복합니다.

이 라우팅 접근 방식은 사용자가 대부분의 워크로드를 처리하는 저비용 프론트엔드로 DeepSeek V4 Pro 0813을 활용하고, 높은 정확도가 필요한 어려운 작업에만 비싼 GPT-5.6 Sol을 예약할 수 있게 합니다.