Anthropic опубликовала дополнение к карточке модели Claude, описывающее Claude 3.5 Sonnet — новую модель, которая превосходит Claude 3 Opus по скорости и стоимости, а также предлагает расширенные возможности в области программирования и обработки изображений.

  • Claude 3.5 Sonnet устанавливает новые стандарты производительности на тестах GPQA (наука уровня аспирантуры), MMLU (общее рассуждение) и HumanEval (навыки программирования).
  • Она достигает лучших результатов в пяти задачах компьютерного зрения, включая MathVista, ChartQA и DocVQA.
  • Во внутренней оценке агентного программирования модель решает 64% задач по сравнению с 38% для Claude 3 Opus.
  • Оценки на основе обратной связи от людей показывают значительное преимущество перед Claude 3 Opus в основных задачах, таких как программирование, работа с документами и креативное письмо.
  • В дополнении также сообщается об улучшении показателей отказа на наборах данных Wildchat и XSTest и почти идеальном запоминании в тестах Needle In A Haystack до 200k токенов.