Google a publié Gemini 3.5 Transcribe, un modèle de reconnaissance vocale conçu pour les interactions vocales intelligentes qui convertit l'audio brut en texte précis et poli tout en gérant le bruit de fond et les hésitations.

  • Atteint un taux d'erreur de mots (WER) moyen de 4,0 % pour le streaming et de 2,6 % pour les cas d'utilisation non en streaming selon Artificial Analysis.
  • Améliore le temps jusqu'à la transcription finale de 70 % par rapport au modèle précédent Chirp 3.
  • Prend en charge plus de 85 langues avec détection automatique et gère le vocabulaire personnalisé pour le jargon spécialisé.
  • Offre le streaming en temps réel via Live API et le traitement de l'audio préenregistré via Interactions API.
  • Permet l'appel de fonctions pour déléguer des tâches comme la génération d'images à d'autres modèles Gemini.

Le modèle est disponible en accès anticipé public via Gemini API, Google AI Studio et la plateforme Gemini Enterprise Agent Platform.