Anthropic은 코드 작성, 지식 작업, 장기 문제 해결 작업에 새로운 기준을 제시하는 모델 업데이트인 Claude Fable 5.1을 출시했습니다. 이번 릴리스는 새로운 Terminal-Bench-Science 0.1 벤치마크에서 상당한 성능 향상을 강조하며, Fable 5.1이 52.6%의 점수를 달성한 반면, Fable 5는 24.7%, Opus 5는 29.0%, GPT-5.6 Sol은 22.4%를 기록했습니다.
- Claude Fable 5.1은 저, 중, 고, 매우 높음, 최대의 다섯 가지 추론 수준을 도입했으며, 추론을 완전히 비활성화하는 옵션은 없습니다.
- pelican SVG 생성 프롬프트에 대한 테스트 결과, 저와 중 수준의 노력은 추론 트레이스를 완전히 건너뛰는 반면, 더 높은 수준은 상세한 내부 독백을 생성했습니다.
- '최대' 추론 수준은 65,927개의 출력 토큰을 필요로 하며 작업당 $3.30의 비용이 발생했으며, 테스트된 모델 중 가장 상세한 시각적 출력을 제공했습니다.
- '높은' 사고 수준을 사용하여 생성된 SVG를 애니메이션화하는 데 $1.37가 소요되었으며, 회전하는 바퀴가 있는 비디오가 생성되었지만 방향이 잘못되었습니다.
이번 업데이트는 사용자가 다양한 추론 노력 수준 간에 모델 성능을 비교할 수 있게 하여, 증가된 계산 투자가 출력 품질과 세부 사항에 미치는 영향을 드러냅니다.