Сравнение моделей DeepSeek-V4 Flash 0731 и GPT-5.6 Luna на бенчмарке DeepSWE показывает, что, хотя GPT-5.6 Luna является более сильным инженером, каскадная стратегия с использованием обеих моделей обеспечивает более высокую точность при меньшей стоимости.

  • GPT-5.6 Luna уверенно лидирует в DeepSWE по показателю pass@1 с результатом 67,2% против 53,3% у DeepSeek, сохраняя преимущество при любом равном количестве попыток.
  • DeepSeek-V4 Flash — самая дешевая модель на рынке: $0,10 за один запуск, что дает 532 решения на $100 по сравнению с 110 решениями у Luna.
  • Запуск DeepSeek первым и переход к Luna только при неудаче позволяет решить 78,9% задач при стоимости $0,385 за каждую, превосходя использование только Luna как по точности, так и по стоимости.
  • DeepSeek завершает работу более чисто: в 9% случаев сбоев он ломает существующий набор тестов репозитория, тогда как у Luna этот показатель составляет 15%.

Каскадный подход использует низкую стоимость DeepSeek для решения примерно половины задач, позволяя флагманской модели сосредоточиться на более сложных проблемах, что в совокупности дает результат лучше, чем использование любой из моделей по отдельности.