Laporan teknis AuK memperkenalkan model fondasional sumber terbuka yang menyatukan generasi dan pengeditan ucapan melalui instruksi bahasa alami dan konteks audio.

  • Model ini dilatih pada sekitar 3,03 miliar pasangan instruksi-audio dan 1,95 juta jam pengawasan di lima keluarga tugas.
  • Arsitektur menggabungkan model bahasa besar multimodal, VAE untuk kondisioning akustik, dan Transformer aliran terikat hibrida.
  • Pasca-pelatihan mencakup optimasi preferensi umpan balik manusia dan pembelajaran penguatan berbasis imbalan.
  • AuK-Flash mencapai inferensi dalam 4 langkah dengan percepatan waktu nyata 4,5 kali lipat dibandingkan model penuh.

Para penulis merilis kode sumber dan bobot model untuk mendukung reproduktibilitas dan penelitian lebih lanjut.