Anthropic은 Claude 3.5 Sonnet에 대한 세부 사항을 담은 Claude 3 모델 카드의 추가 문서를 게시했으며, 이 새로운 모델은 속도와 비용 측면에서 Claude 3 Opus를 능가하며 코딩 및 시각 처리 기능에서 향상된 능력을 제공합니다.
- Claude 3.5 Sonnet는 대학원 수준 과학(GPQA), 일반 추론(MMLU), 코딩 숙련도(HumanEval)에서 새로운 성능 기준을 설정합니다.
- MathVista, ChartQA, DocVQA를 포함한 다섯 가지 비전 벤치마크에서 최상위 결과를 달성합니다.
- 내부 에이전트 코딩 평가에서 이 모델은 Claude 3 Opus의 38% 대비 64%의 문제를 해결합니다.
- 인간 피드백 평가는 코딩, 문서, 창의적 글쓰기 등 핵심 기능에서 Claude 3 Opus에 비해 상당한 우세율을 보여줍니다.
- 추가 문서는 Wildchat 및 XSTest 데이터셋에서 개선된 거부율과 최대 200k 토큰까지의 Needle In A Haystack 테스트에서 거의 완벽한 회상을 보고합니다.