Google AI telah merilis Gemini 3.5 Transcribe, sebuah model ucapan-ke-teks yang tersedia melalui dua titik akhir API yang berbeda: API Interactions untuk file yang sudah direkam sebelumnya dan API Live untuk streaming waktu nyata.
- Model ini melaporkan tingkat kesalahan kata rata-rata sebesar 2,6% untuk non-streaming dan 4,0% untuk streaming, sebagaimana diukur oleh Artificial Analysis.
- Waktu hingga transkripsi akhir membaik sebesar 70% dibandingkan dengan model Chirp 3 sebelumnya.
- Deteksi otomatis mendukung lebih dari 85 bahasa, termasuk pengalihan kode di tengah kalimat.
- API Live menawarkan latensi di bawah satu detik tetapi tidak memiliki diarisasi pembicara dan timestamp tingkat kata, yang tersedia di API Interactions.
- Mode Smart menghilangkan ketidakalusan ucapan tetapi tidak dapat digabungkan dengan timestamp atau diarisasi.
Pemisahan antara titik akhir memungkinkan pengembang memilih antara streaming berlatensi rendah untuk antarmuka waktu nyata atau fitur transkripsi terperinci untuk pemrosesan pasca.