Anthropic опубликовала дополнение к карточке модели Claude, описывающее Claude 3.5 Sonnet — новую модель, которая превосходит Claude 3 Opus по скорости и стоимости, а также предлагает расширенные возможности в области программирования и обработки изображений.
- Claude 3.5 Sonnet устанавливает новые стандарты производительности на тестах GPQA (наука уровня аспирантуры), MMLU (общее рассуждение) и HumanEval (навыки программирования).
- Она достигает лучших результатов в пяти задачах компьютерного зрения, включая MathVista, ChartQA и DocVQA.
- Во внутренней оценке агентного программирования модель решает 64% задач по сравнению с 38% для Claude 3 Opus.
- Оценки на основе обратной связи от людей показывают значительное преимущество перед Claude 3 Opus в основных задачах, таких как программирование, работа с документами и креативное письмо.
- В дополнении также сообщается об улучшении показателей отказа на наборах данных Wildchat и XSTest и почти идеальном запоминании в тестах Needle In A Haystack до 200k токенов.