구글은 응답하기 전에 사고를 통해 추론할 수 있는 최신 "사고" AI 모델 패밀리인 Gemini 2.5를 출시했습니다. 첫 번째 릴리스는 광범위한 벤치마크에서 최상위 성능을 달성하고 LMArena 리더보드에서 1위를 차지한 실험용 Gemini 2.5 Pro입니다.

  • Gemini 2.5 Pro는 LMArena 리더보드에서 압도적인 차이로 1위를 차지하여 높은 품질의 스타일과 능력을 보여줍니다.
  • 다수결 투표와 같은 테스트 타임 기법을 사용하지 않고 GPQA 및 AIME 2025와 같은 수학 및 과학 벤치마크에서 선두를 달립니다.
  • 지식의 인간적 최전선을 포착하는 데이터셋인 Humanity’s Last Exam에서 최상위 성능인 18.8%를 기록합니다.
  • SWE-Bench Verified에서는 에이전틱 코드 평가를 위한 커스텀 에이전트 설정으로 63.8%의 점수를 얻었습니다.
  • 100만 토큰의 컨텍스트 윈도우를 제공하며, 곧 200만 토큰이 지원될 예정입니다. 텍스트, 오디오, 이미지, 비디오 및 코드 저장소를 지원합니다.

Gemini 2.5 Pro는 현재 Google AI Studio와 고급 사용자를 위한 Gemini 앱에서 이용 가능하며, Vertex AI는 향후 몇 주 이내에 출시될 예정입니다.