Laporan teknis AuK memperkenalkan model fondasional sumber terbuka yang menyatukan generasi dan pengeditan ucapan melalui instruksi bahasa alami dan konteks audio.
- Model ini dilatih pada sekitar 3,03 miliar pasangan instruksi-audio dan 1,95 juta jam pengawasan di lima keluarga tugas.
- Arsitektur menggabungkan model bahasa besar multimodal, VAE untuk kondisioning akustik, dan Transformer aliran terikat hibrida.
- Pasca-pelatihan mencakup optimasi preferensi umpan balik manusia dan pembelajaran penguatan berbasis imbalan.
- AuK-Flash mencapai inferensi dalam 4 langkah dengan percepatan waktu nyata 4,5 kali lipat dibandingkan model penuh.
Para penulis merilis kode sumber dan bobot model untuk mendukung reproduktibilitas dan penelitian lebih lanjut.