Le rapport technique d'AuK présente un modèle fondamental open-source qui unifie la génération et l'édition de parole grâce à des instructions en langage naturel et au contexte audio.
- Le modèle est entraîné sur environ 3,03 milliards d'instances instruction-audio et 1,95 million d'heures de supervision dans cinq familles de tâches.
- L'architecture combine un grand modèle de langage multimodal, un VAE pour le conditionnement acoustique et un Transformer hybride à flux rectifié.
- Le post-apprentissage inclut l'optimisation des préférences par retour humain et l'apprentissage par renforcement basé sur la récompense.
- AuK-Flash réalise une inférence en 4 étapes, offrant un gain de vitesse de 4,5 fois en temps réel par rapport au modèle complet.
Les auteurs publient le code source et les poids du modèle pour soutenir la reproductibilité et la recherche future.