Google a publié une fiche modèle pour Gemini 2.0 Flash, un modèle nativement multimodal de la série Gemini 2.0 conçu pour alimenter les systèmes agents. Le modèle améliore Gemini 1.5 Flash avec une qualité supérieure et surpasse Gemini 1.5 Pro sur les benchmarks clés à deux fois la vitesse.

  • Prend en charge les entrées texte, images, audio et vidéo avec une fenêtre de contexte de 1 048 576 tokens.
  • Atteint 77,6 % sur MMLU-Pro, 34,5 % sur LiveCodeBench (v5) et 90,9 % sur les benchmarks MATH.
  • Offre un support à faible latence pour le streaming en temps réel via Multimodal Live API.
  • Entraîné à l'aide des Tensor Processing Units (TPUs) de Google avec JAX et ML Pathways.

Le modèle est positionné comme une voie de mise à niveau pour les utilisateurs recherchant une qualité améliorée ou des performances légèrement supérieures avec des capacités de latence en temps réel.