Google memperkenalkan Gemma 3, keluarga baru model multimodal terbuka ringan yang berkisar dari 1 hingga 27 miliar parameter. Pembaruan ini menambahkan pemahaman visual, dukungan untuk setidaknya 128K token konteks, dan cakupan multibahasa yang lebih luas dibandingkan versi sebelumnya.

  • Model menggunakan encoder visi SigLIP yang disesuaikan dengan metode Pan & Scan untuk resolusi gambar yang fleksibel.
  • Perubahan arsitektur mencakup interleaving 5:1 dari lapisan perhatian lokal ke global untuk mengurangi penggunaan memori KV-cache selama inferensi konteks panjang.
  • Model 1B mendukung konteks 32K, sedangkan model yang lebih besar mendukung 128K token.
  • Pelatihan menggunakan distilasi pengetahuan dari model frontier Gemini dan resep pasca-pelatihan yang baru.
  • Gemma3-4B-IT mencapai kinerja setara dengan Gemma2-27B-IT, dan Gemma3-27B-IT sebanding dengan Gemini-1.5-Pro pada benchmark.

Rilis ini menyediakan semua varian model kepada komunitas, memungkinkan kemampuan multimodal yang kuat pada perangkat keras konsumen standar.