Google a introduit Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, des modèles natifs de parole à parole conçus pour les agents vocaux en temps réel qui raisonnent et exécutent des outils sans interrompre le flux conversationnel.

  • Les deux modèles sont désormais disponibles dans l'API Gemini Live et Google AI Studio en tant que solutions hébergées.
  • Gemini 3.8 Live se concentre sur l'évolutivité et l'efficacité des coûts, tandis qu'Extended Thinking ajoute des capacités de raisonnement multi-étapes.
  • Extended Thinking occupe la première place de l'indice de qualité parole à parole d'Artificial Analysis avec un score de 82,6.
  • Les modèles prennent en charge l'appel de fonctions asynchrone, le contexte visuel, la précision alphanumérique et 97 langues.
  • La tarification est fixée à 0,005 $/min pour l'entrée audio et 0,018 $/min pour la sortie audio via l'API Live.

Ces versions offrent une alternative simplifiée aux pipelines de parole en cascade, permettant aux développeurs de créer des agents vocaux de qualité production avec une utilisation intégrée d'outils et une faible latence.