Tim Qwen dari Alibaba telah merilis Qwen3.8-Omni-Flash, model omni-modal pertamanya yang dirancang seputar kemampuan agentic untuk pemahaman audio-video dan penggunaan alat. Model ini menerima input teks, gambar, audio, dan video untuk menghasilkan output teks, dengan jendela konteks 1M token dan pemanggilan fungsi asli.
- Dibangun di atas arsitektur Qwen3.8-Flash-Next, model ini menawarkan konteks 1M token dengan maksimal 991K token input dan 131K token output.
- Model ini menggunakan alur kerja persepsi agentic untuk video panjang, meningkatkan akurasi OmniVideoBench dari 63,4 menjadi 67,8 sambil mengurangi penggunaan token sebesar 45,7%.
- Model ini menunjukkan peningkatan kinerja yang signifikan dibandingkan Qwen3.5-Omni-Plus, dengan skor rata-rata meningkat lebih dari 25% di seluruh 29 evaluasi.
- Model ini tersedia melalui API di QwenCloud, Alibaba Cloud Model Studio, dan Qwen Studio, dengan harga $0,15 per 1M token input dan $0,47 per 1M token output.
- Tim tersebut juga membuka sumber kode Qwen-MM-Plugins di bawah lisensi Apache-2.0 untuk mendukung harness agen multimodal.
Rilis ini menyediakan solusi terhosting untuk alur kerja agentic kompleks yang melibatkan analisis audio dan video panjang-form, dengan pengurangan biaya dilaporkan lebih dari 93% untuk input audio-visual dibandingkan model sebelumnya.