Anthropic은 벤치마크 최적화뿐만 아니라 실제 비즈니스 및 개발자 사용 사례를 위해 설계된 모델인 Claude 3.7 Sonnet을 출시했습니다. 이번 릴리스는 표준 모드와 고급 추론 모드 간에 동적으로 전환할 수 있는 기능을 도입하여 사용자가 "생각 시간"에 할당되는 토큰 수를 제어할 수 있게 합니다.
- 가격은 입력 토큰당 $3/M, 출력 토큰당 $15/M로 설정되어 OpenAI의 o1과 DeepSeek R1 사이에 위치합니다.
- 이 모델은 표준 모드에서 약 200ms의 지연 시간을 제공하고 확장된 생각 모드에서는 최대 15초까지 지원하는 하이브리드 아키텍처를 특징으로 합니다.
- 벤치마크 결과 대학원 수준의 추론(GPQA Diamond: 78.2% / 84.8%) 및 코딩(SWE-bench: 62.3% / 70.3%)에서 강력한 성능을 보였으나, 고등학교 수학 경시대회 점수에서는 어려움을 겪었습니다.
- 독립적인 평가에 따르면 Claude 3.7 Sonnet을 포함한 테스트된 모든 모델은 복잡한 수학 문제에서 신뢰할 수 없으며, SAT 스타일 질문에서 모두 동전 던지기 수준의 점수를 기록했습니다.
구성 가능한 지연 시간 및 토큰 예산 제어를 통해 개발자는 서로 다른 작업에 별도의 모델이 필요하지 않고 속도와 정확성 간의 균형을 유연하게 맞출 수 있습니다.