Google telah meluncurkan EmbeddingGemma 2, sebuah model embedding multimoda sumber terbuka yang menyatukan kode, gambar, video, dan audio dalam ruang bersama. Dibangun di atas arsitektur Gemma 4 dengan 740 juta parameter, model ini dirancang untuk inferensi perangkat yang efisien di bawah lisensi Apache 2.0 yang permisif secara komersial.
- Mencapai skor terdepan di antara embedding multimoda sub-1B di benchmark MTEB Code dan MAEB.
- Desain modular memungkinkan beban kerja hanya teks berjalan dengan parameter sebanyak 270M, dengan encoder visi dan audio opsional.
- Menggunakan Matryoshka Representation Learning untuk memangkas vektor dari 768 menjadi 128 dimensi guna mengurangi penyimpanan hingga 6x.
- Memerlukan RAM aktif sebesar ~191MB hanya untuk bobot teks saja pada Google Pixel 11 Pro.
- Dilengkapi jendela konteks token 8K, empat kali lebih besar daripada versi sebelumnya.
Model ini memungkinkan pencarian semantik dan pengambilan data yang kuat sepenuhnya di perangkat tepi, memastikan privasi data dan mengurangi latensi pipa. Ketika dipasangkan dengan model generatif seperti Gemma 4, model ini memfasilitasi pipa RAG perangkat yang memproses data multimoda kompleks secara offline.