Сравнительный анализ GLM-5.3 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что стратегия каскадной маршрутизации превосходит использование любой из моделей по отдельности. Запуская сначала GLM-5.3 и переходя к GPT-5.6 Sol только при сбое тестов, система решает 85,9% задач за $6,61 за задачу.
- Стоимость GLM-5.3 составляет $3,99 за прогон по сравнению с $8,37 у Sol, что делает её в 2,1 раза дешевле и даёт 17 решённых задач на каждые $100 против 9 у Sol.
- GPT-5.6 Sol лидирует по точности одиночного запуска (pass@1 = 72,7%) и надёжности (4 задачи из 4), тогда как GLM-5.3 делит лидерство по pass@2 и лидирует по pass@4 (87,6%).
- Модели существенно расходятся с корреляцией 0,43 на задачу, покрывая вместе 106 из 113 задач, что обеспечивает эффективность каскада.
- GLM-5.3 демонстрирует более чистые режимы сбоев: ломает существующие тесты лишь в 11% случаев против 20% у Sol, снижая потребность в жёсткой регрессионной фильтрации.
Этот подход использует GLM-5.3 как фронтенд с низкой стоимостью и Sol как верификатор для эскалации, обеспечивая более высокое покрытие, чем только Sol, оставаясь при этом дешевле одного прогона Sol.