Anthropic выпустила Claude 3.7 Sonnet, модель, предназначенную для реальных бизнес- и разработческих задач, а не только для оптимизации бенчмарков. Выпуск включает возможность динамического переключения между стандартным и расширенным режимами рассуждения, позволяя пользователям контролировать количество токенов, выделяемых на «время размышления».

  • Цена установлена на уровне $3/M входных токенов и $15/M выходных токенов, что позиционирует её между OpenAI o1 и DeepSeek R1.
  • Модель использует гибридную архитектуру, обеспечивающую задержку около 200 мс в стандартном режиме и до 15 секунд в режиме расширенного размышления.
  • Бенчмарки демонстрируют высокую производительность в рассуждениях на уровне аспирантуры (GPQA Diamond: 78,2% / 84,8%) и программировании (SWE-bench: 62,3% / 70,3%), хотя модель испытывает трудности с результатами школьных математических олимпиад.
  • Независимые оценки показывают, что ни одна из протестированных моделей, включая Claude 3.7 Sonnet, не является надёжной для сложных математических задач, все они показывают результаты на уровне случайного угадывания по вопросам в стиле SAT.

Настраиваемый контроль задержки и бюджета токенов предоставляет разработчикам гибкость для балансировки скорости и точности без необходимости использования отдельных моделей для разных задач.