DeepSWEベンチマークにおけるGLM-5.3とGPT-5.6 Solの比較分析により、カスケードルーティング戦略が単独で使用されるいずれかのモデルを上回ることを示した。まずGLM-5.3を実行し、テスト失敗時のみGPT-5.6 Solにエスカレーションすることで、システムはタスクあたり$6.61で85.9%のタスクを解決する。

  • GLM-5.3のロールアウトコストは$3.99であるのに対しSolは$8.37であり、2.1倍安価で、100ドルあたり17件のタスクを解決するのに対しSolは9件にとどまる。
  • GPT-5.6 Solは単一ショット精度(pass@1: 72.7%)と信頼性(4回中4回すべて解決したタスクが61件)で首位に立ち、GLM-5.3はpass@2で同率首位、pass@4で首位(87.6%)となる。
  • 両モデルはタスクあたり相関0.43という大きな乖離を示し、113件中106件をカバーしており、これが効果的なカスケードを可能にする。
  • GLM-5.3はよりクリーンな失敗モードを示し、失敗時の既存テスト破壊率がSolの20%に対し11%にとどまり、重い回帰ゲートイングの必要性を低減する。

このアプローチはGLM-5.3を低コストなフロントエンドとして、Solを検証者ゲート付きエスカレーションとして活用し、Sol単独よりも高いカバレッジを実現しながら、単一Solロールアウトよりも安価に抑える。