Google DeepMind telah merilis EmbeddingGemma 2, sebuah model embedding multimodal sumber terbuka yang dibangun di atas arsitektur Gemma 4 dan meng-embed teks, kode, gambar, video, serta audio ke dalam ruang vektor bersama berdimensi 768. Model ini memiliki 740 juta parameter dengan desain modular yang memungkinkan varian lebih kecil hanya untuk teks atau visi-audio, serta mendukung jendela konteks sepanjang 8K token.
- EmbeddingGemma 2 mencapai skor terdepan di antara peng-embed multimodal sub-1B, termasuk 78.68 pada MTEB Code v1 dan 49.39 pada MAEB (audio).
- Model ini dioptimalkan untuk penyiapan di perangkat, membutuhkan sekitar 191MB RAM untuk bobot hanya teks dan 567MB untuk model multimodal penuh pada Pixel 11 Pro.
- Model ini memanfaatkan Matryoshka Representation Learning untuk memungkinkan pemendekan vektor ke 512, 256, atau 128 dimensi, secara signifikan mengurangi kebutuhan penyimpanan dengan kehilangan performa yang minimal.
- Bobot tersedia di bawah lisensi Apache 2.0 di Hugging Face dan Kaggle, dengan dukungan untuk Ollama, llama.cpp, LiteRT, dan kerangka kerja lainnya.
Rilis ini memungkinkan pencarian kembali yang diperkaya (RAG) serta kemampuan pencarian lokal yang mengutamakan privasi dengan memungkinkan pengembang menjalankan embedding langsung di perangkat tanpa mengirim data ke cloud.