Tim Qwen di Alibaba Group telah menerbitkan laporan teknis yang merinci Qwen2.5-VL, model andalan terbaru dalam seri visi-bahasa mereka. Laporan tersebut menguraikan kemajuan signifikan dalam pengenalan visual, lokalisasi objek, pemrosesan dokumen, dan pemahaman video panjang.
- Model ini memperkenalkan pemrosesan resolusi dinamis dan pengodean waktu absolut untuk menangani gambar dengan ukuran bervariasi serta video hingga berdurasi jam dengan lokalisasi peristiwa tingkat detik.
- Vision Transformer (ViT) resolusi dinamis asli dengan Window Attention mengurangi beban komputasi sambil mempertahankan resolusi asli.
- Korpus pra-pelatihan diperluas dari 1,2 triliun token menjadi 4,1 triliun token, meningkatkan kinerja di berbagai domain tanpa penyetelan halus khusus tugas.
- Model andalan Qwen2.5-VL-72B menyamai model mutakhir seperti GPT-4o dan Claude 3.5 Sonnet, sementara varian lebih kecil 7B dan 3B mengungguli pesaing dalam lingkungan dengan keterbatasan sumber daya.
Laporan tersebut menekankan kemampuan model untuk berfungsi sebagai agen visual interaktif untuk penalaran dan pelaksanaan tugas pada komputer dan perangkat seluler.