Обзор передовых систем рассуждения ИИ от лабораторий, включая OpenAI, DeepMind, xAI, DeepSeek и Anthropic, показывает, что хотя масштабирование вычислений во время тестирования повышает точность, оно значительно снижает эффективность. Анализ выявляет Парето-фронт для показателей ARC-AGI-1, но отмечает полный провал на более сложном бенчмарке ARC-AGI-2, что указывает на общие ограничения всех основных моделей.

  • Современные системы рассуждения полагаются на длительные инференсы, перекомпозицию знаний и параллельную выборку CoT для увеличения «времени на размышления».
  • o3-medium/high от OpenAI обеспечивает наивысшую точность при высокой стоимости, в то время как Gemini 2.5 Flash от Google предлагает баланс между точностью и стоимостью.
  • Grok 3 mini-low от xAI дает умеренное улучшение точности по сравнению с чистыми LLM при меньших требованиях к ресурсам.
  • ARC-AGI-2 остается нерешенным для всех протестированных систем, что указывает на недостаточность текущих стратегий масштабирования для достижения прорывной способности AGI.

Выводы указывают на отсутствие единого универсального победителя и то, что системы рассуждения ИИ не имеют сильного соответствия рынку по сравнению с чистыми LLM из-за несогласованности API и трения при внедрении.