Google memperkenalkan Gemma 3, keluarga baru model multimodal terbuka ringan yang berkisar dari 1 hingga 27 miliar parameter. Pembaruan ini menambahkan pemahaman visual, dukungan untuk setidaknya 128K token konteks, dan cakupan multibahasa yang lebih luas dibandingkan versi sebelumnya.
- Model menggunakan encoder visi SigLIP yang disesuaikan dengan metode Pan & Scan untuk resolusi gambar yang fleksibel.
- Perubahan arsitektur mencakup interleaving 5:1 dari lapisan perhatian lokal ke global untuk mengurangi penggunaan memori KV-cache selama inferensi konteks panjang.
- Model 1B mendukung konteks 32K, sedangkan model yang lebih besar mendukung 128K token.
- Pelatihan menggunakan distilasi pengetahuan dari model frontier Gemini dan resep pasca-pelatihan yang baru.
- Gemma3-4B-IT mencapai kinerja setara dengan Gemma2-27B-IT, dan Gemma3-27B-IT sebanding dengan Gemini-1.5-Pro pada benchmark.
Rilis ini menyediakan semua varian model kepada komunitas, memungkinkan kemampuan multimodal yang kuat pada perangkat keras konsumen standar.