Google DeepMind telah merilis laporan teknis Gemma 3, memperkenalkan pembaruan multimodal ke keluarga model terbuka ringan Gemma yang berkisar dari 1 hingga 27 miliar parameter. Versi ini menambahkan pemahaman visual, mendukung setidaknya 128K token konteks, dan memodifikasi arsitektur untuk mengurangi penggunaan memori KV-cache.
- Arsitektur model meningkatkan rasio lapisan perhatian lokal terhadap global dan mempertahankan rentang perhatian lokal yang pendek untuk mengelola memori konteks panjang.
- Pelatihan memanfaatkan distilasi, dengan resep pasca-pelatihan baru yang secara signifikan meningkatkan kemampuan matematika, obrolan, penurutan instruksi, dan multibahasa.
- Gemma3-4B-IT mencapai kinerja yang sebanding dengan Gemma2-27B-IT, sementara Gemma3-27B-IT kompetitif dengan Gemini-1.5-Pro di berbagai benchmark.
Para penulis merilis semua model kepada komunitas, bertujuan untuk memberikan kinerja yang lebih unggul dibandingkan versi sebelumnya untuk aplikasi pra-pelatihan dan penyetelan halus instruksi.