Meta Superintelligence Labs ha lanzado Muse Voice Transcribe, un modelo autoregresivo único que realiza reconocimiento automático de voz (ASR) en streaming, diarización de hablantes para más de 20 hablantes y detección de límites en una sola pasada. El modelo está disponible como una API alojada en la Meta Model API bajo el nombre muse-voice-transcribe-1.0.

  • Alcanza una tasa de error de palabras del 3,1% en la transcripción final con una latencia de 0,16s en los benchmarks AA-WER Streaming de Artificial Analysis.
  • El aprendizaje por refuerzo entrena una política de retardo adaptativo que varía por palabra para equilibrar precisión y velocidad.
  • El modelo admite entradas de audio superiores a una hora y cambio de código nativo entre más de 70 idiomas.
  • El precio es de $3,00 por cada 1.000 minutos de audio, por debajo de competidores como Cartesia Ink-2 y ElevenLabs Scribe v2 Realtime.

El sistema impulsa la dictado en Meta AI para Mac y Muse Code, ofreciendo una solución unificada que reduce la latencia y los modos de fallo asociados con pilas de múltiples modelos.