El informe técnico de AuK presenta un modelo fundamental de código abierto que unifica la generación y edición de voz mediante instrucciones en lenguaje natural y contexto de audio.
- El modelo se entrena con aproximadamente 3.03 mil millones de instancias de instrucción-audio y 1.95 millones de horas de supervisión en cinco familias de tareas.
- La arquitectura combina un gran modelo de lenguaje multimodal, un VAE para condicionamiento acústico y un Transformer híbrido de flujo rectificado.
- El postentrenamiento incluye optimización de preferencias con retroalimentación humana y aprendizaje por refuerzo basado en recompensas.
- AuK-Flash logra inferencia en 4 pasos con una aceleración de 4.5 veces en tiempo real respecto al modelo completo.
Los autores publican el código fuente y los pesos del modelo para apoyar la reproducibilidad y la investigación futura.