Google AI a publié Gemini 3.5 Transcribe, un modèle de reconnaissance vocale en texte disponible via deux points de terminaison API distincts : l'API Interactions pour les fichiers préenregistrés et l'API Live pour le streaming en temps réel.
- Le modèle affiche un taux d'erreur de mots (WER) moyen de 2,6 % pour le non-streaming et de 4,0 % pour le streaming, selon les mesures d'Artificial Analysis.
- Le temps nécessaire à la transcription finale est réduit de 70 % par rapport au précédent modèle Chirp 3.
- La détection automatique prend en charge plus de 85 langues, y compris les changements de langue en plein milieu d'une phrase.
- L'API Live offre une latence inférieure à une seconde mais ne propose ni diarisation des locuteurs ni horodatages au niveau des mots, disponibles dans l'API Interactions.
- Le mode intelligent supprime les hésitations mais ne peut pas être combiné avec des horodatages ou la diarisation.
La séparation entre les points de terminaison permet aux développeurs de choisir entre un streaming à faible latence pour les interfaces en direct ou des fonctionnalités de transcription détaillées pour le post-traitement.