FireRedTeam ha lanzado dos nuevos modelos de audio de código abierto: FireRedAudio, un modelo de lenguaje de audio de propósito general, y FireRedTTS3, un sistema unificado de generación y edición de voz.
- FireRedAudio está construido sobre un LLM compartido de 9B parámetros con representaciones continuas desacopladas, que soporta ASR, comprensión de audio, TTS zero-shot, instruct TTS, edición de habla semántica/acústica y alineación temporal para grabaciones de hasta una hora.
- FireRedTTS3-Base permite clonación de voz zero-shot en 24 idiomas y 21 dialectos chinos, obteniendo resultados competitivos en los benchmarks MiniMax-MLS-Test y Seed-TTS-eval.
- FireRedTTS3-Instruct permite el diseño de voz mediante lenguaje natural y la edición de habla libre (semántica y acústica) dentro de un único modelo unificado.
Estos lanzamientos proporcionan a los usuarios herramientas integrales tanto para comprender contextos de audio complejos como para generar habla multilingüe de alta fidelidad.