SpaceXAI telah merilis Grok Voice Transcribe 2.0, sebuah model speech-to-text yang tersedia melalui API terhosting dan mengklaim memiliki akurasi dua kali lipat dibandingkan versi 1.0 pada titik harga yang sama. Model ini menargetkan kondisi audio yang sulit seperti saluran telepon berisik dan suara yang bersaing, berjalan dalam mode batch maupun streaming real-time.
- Peringkat pertama di antara 32 model streaming pada papan peringkat Artificial Analysis menggunakan benchmark AA-WER Streaming.
- Mencapai penurunan word error rate dari 20,6% menjadi 6,8% pada frasa pendek di 19 bahasa, yang mewakili sekitar 67% lebih sedikit kesalahan.
- Mendukung deteksi bahasa otomatis dan pengalihan bahasa selama rekaman untuk puluhan bahasa.
- Menyertakan fitur seperti speaker diarization, timestamp tingkat kata, penekanan istilah kunci, dan penghapusan filler word tanpa biaya tambahan.
- Dihargai $0.10 per jam untuk transkripsi batch dan $0.20 per jam untuk streaming.
Atlassian Loom telah mengadopsi API ini untuk mentranskripsi setiap video dalam alur kerjanya, dengan menyebutkan akurasi yang lebih tinggi dibandingkan solusi sebelumnya.