Microsoft telah merilis Mage-VL, model dasar multimodal 4B-parameter yang efisien untuk pemahaman gambar dan video yang menggunakan pendekatan asli codec untuk menyederhanakan pemrosesan visual. Sistem ini memisahkan aliran video menjadi frame jangkar (I) dan frame prediksi (P), hanya mempertahankan patch di mana codec mengalokasikan bit untuk mengurangi konsumsi token visual lebih dari 75%.
- Mage-VL menggabungkan encoder visual Codec-ViT dari awal dengan tulang punggung decoder bahasa kausal Qwen3-4B.
- Arsitektur ini mencapai percepatan inferensi waktu dinding hingga 3.5× dibandingkan pengambilan frame seragam sambil mempertahankan konteks spasial-temporal.
- Desain proses ganda System 1 & System 2 menambahkan streaming proaktif, menggunakan gerbang kognisi ringan untuk memanggil VLM penuh hanya ketika diperlukan.
- Pada benchmark video, Mage-VL meningkatkan kinerja Qwen3-VL-4B pada setiap metrik yang dilaporkan, dengan peningkatan signifikan dalam tugas yang bergantung pada lokalisasi seperti +22.5 pada QVHighlight.
Model ini menargetkan pertukaran antara penalaran offline kompleks dan persepsi streaming waktu nyata, menawarkan solusi model tunggal untuk komentar gerbang peristiwa latensi rendah.