구글은 복잡한 작업과 향상된 추론 능력을 위해 설계된 가장 고급 사고 모델인 Gemini 2.5 Pro의 실험 버전을 출시했습니다. 이 모델은 LMArena 리더보드에서 큰 격차로 정상을 차지했으며 다양한 벤치마크에서 최첨단 성능을 보여줍니다.

  • 고품질 스타일과 강력한 추론 능력으로 LMArena 리더보드 1위.
  • 테스트 타임 기법 없이 GPQA 및 AIME 2025와 같은 수학 및 과학 벤치마크에서 선두.
  • Humanity’s Last Exam에서 18.8% 점수 획득, 인간의 지식 한계 포착.
  • 에이전트 코드 평가를 위한 SWE-Bench Verified에서 63.8% 달성.
  • 네이티브 멀티모달리티 지원을 갖춘 100만 토큰 컨텍스트 윈도우 특징.

이 모델은 이제 고급 사용자를 위해 Google AI Studio 및 Gemini 앱에서 사용할 수 있으며, Vertex AI 통합 및 가격 정보는 향후 몇 주 안에 예상됩니다.