Google과 Google DeepMind는 텍스트, 코드, 오디오, 이미지 및 비디오를 네이티브로 이해하고 결합하도록 설계된 대규모 멀티모달 모델의 새로운 패밀리인 Gemini 1.0을 소개했습니다.

  • 첫 번째 버전에는 세 가지 최적화된 크기가 포함됩니다: 복잡한 작업을 위한 Gemini Ultra, 작업 간 확장을 위한 Gemini Pro, 그리고 디바이스 효율성을 위한 Gemini Nano.
  • Gemini Ultra는 널리 사용되는 32개의 학술 벤치마크 중 30개에서 최첨단 성능을 달성했으며, MMLU에서 인간 전문가를 90.0%의 점수로 능가한 최초의 모델입니다.
  • 이 모델들은 처음부터 멀티모달로 구축되어 별도의 구성 요소를 연결하는 데 의존하지 않고 다양한 입력에 대해 추론할 수 있습니다.

이 릴리스는 개발자와 기업이 애플리케이션을 구축하고 확장하는 방식을 향상시킬 수 있는 범용 AI 구축에서 중요한 한 걸음을 나타냅니다.