Google et Google DeepMind ont présenté Gemini 1.0, une nouvelle famille de modèles multimodaux à grande échelle conçus pour comprendre et combiner nativement le texte, le code, l'audio, l'image et la vidéo.

  • La première version comprend trois tailles optimisées : Gemini Ultra pour les tâches complexes, Gemini Pro pour la mise à l'échelle entre les tâches et Gemini Nano pour l'efficacité sur l'appareil.
  • Gemini Ultra atteint des performances de pointe sur 30 des 32 benchmarks académiques largement utilisés et est le premier modèle à surpasser les experts humains sur MMLU avec un score de 90,0 %.
  • Les modèles sont construits dès la base pour être multimodaux, leur permettant de raisonner sur des entrées diverses sans dépendre de composants séparés cousus ensemble.

Cette version représente une étape significative dans la construction d'une IA à usage général capable d'améliorer la façon dont les développeurs et les entreprises créent et mettent à l'échelle des applications.