Google e Google DeepMind apresentaram o Gemini 1.0, uma nova família de modelos multimodais em larga escala projetados para compreender e combinar texto, código, áudio, imagem e vídeo nativamente.

  • A primeira versão inclui três tamanhos otimizados: Gemini Ultra para tarefas complexas, Gemini Pro para escalonamento entre tarefas e Gemini Nano para eficiência no dispositivo.
  • O Gemini Ultra alcança desempenho de ponta em 30 dos 32 benchmarks acadêmicos amplamente utilizados e é o primeiro modelo a superar especialistas humanos no MMLU com uma pontuação de 90.0%.
  • Os modelos são construídos do zero para serem multimodais, permitindo que raciocinem sobre entradas diversas sem depender de componentes separados costurados juntos.

Este lançamento representa um passo significativo na construção de IA de propósito geral que pode aprimorar como desenvolvedores e empresas criam e escalam aplicações.