O relatório técnico do AuK apresenta um modelo fundamental de código aberto que unifica a geração e edição de fala por meio de instruções em linguagem natural e contexto de áudio.
- O modelo é treinado com aproximadamente 3,03 bilhões de instâncias de instrução-áudio e 1,95 milhão de horas de supervisão em cinco famílias de tarefas.
- A arquitetura combina um grande modelo de linguagem multimodal, um VAE para condicionamento acústico e um Transformer híbrido de fluxo retificado.
- O pós-treinamento inclui otimização de preferências com feedback humano e aprendizado por reforço baseado em recompensas.
- O AuK-Flash realiza inferência em 4 etapas, proporcionando uma aceleração de 4,5 vezes no tempo real em comparação ao modelo completo.
Os autores lançam o código-fonte e os pesos do modelo para apoiar a reprodutibilidade e pesquisas futuras.