Сравнение Kimi K3 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что хотя GPT-5.6 Sol лидирует по качеству в режиме одного запроса (72,7% против 68,5%), Kimi K3 достигает более высоких показателей pass@k при k > 1 при значительно меньшей стоимости.

  • Kimi K3 выигрывает по pass@2 (82,0% против 81,0%) и pass@4 (89,4% против 85,8%), достигая лучшего результата pass@4 среди всех конфигураций флагманского уровня.
  • Стоимость Kimi K3 составляет $4,65 за один прогон по сравнению с $8,37 у GPT-5.6 Sol, что обеспечивает в 2,8 раза больше решённых задач на доллар.
  • Модели существенно расходятся (корреляция 0,46) и терпят неудачу по-разному, что позволяет использовать каскадный подход с приоритетом Kimi и переходом к Sol для покрытия 108 из 113 задач.
  • GPT-5.6 Sol более надёжен: он решает 61 задачу идеально (четыре из четырёх), в то время как у Kimi K3 таких случаев 45, но время на один прогон больше (17 минут против 66 минут).

Маршрутизация между двумя моделями обеспечивает эффективное практическое решение: каскадный подход с приоритетом Kimi достигает точности около 85,6% при стоимости ниже, чем использование только GPT-5.6 Sol.