Google telah merilis Gemini 3.5 Transcribe, sebuah model ucapan-ke-teks yang dirancang untuk interaksi suara cerdas yang mengubah audio mentah menjadi teks yang akurat dan halus sambil menangani kebisingan latar belakang dan ketidakmulusan bicara.
- Mencapai Tingkat Kesalahan Kata (WER) rata-rata sebesar 4,0% untuk streaming dan 2,6% untuk kasus penggunaan non-streaming diukur oleh Artificial Analysis.
- Meningkatkan waktu hingga transkripsi akhir sebesar 70% dibandingkan dengan model Chirp 3 sebelumnya.
- Mendukung lebih dari 85 bahasa dengan deteksi otomatis dan menangani kosakata kustom untuk jargon khusus.
- Menawarkan streaming real-time melalui Live API dan pemrosesan audio rekaman awal melalui Interactions API.
- Mengaktifkan panggilan fungsi untuk mendelegasikan tugas seperti generasi gambar ke model Gemini lainnya.
Model ini tersedia dalam pratinjau publik melalui Gemini API, Google AI Studio, dan platform Gemini Enterprise Agent Platform.