Google DeepMind telah merilis EmbeddingGemma 2, sebuah model embedding multimodal sumber terbuka yang memetakan teks, kode, gambar, video, dan audio ke dalam ruang vektor terpadu 768 dimensi. Model ini terdiri dari total 740 juta parameter, menggabungkan encoder teks 270M parameter dengan encoder visi (170M) dan audio (300M) modular.

  • Dirancang untuk berjalan pada perangkat konsumen seperti perangkat seluler dan laptop untuk representasi semantik latensi rendah.
  • Mendukung aplikasi on-device termasuk pencarian, generasi yang diperkaya pengambilan (RAG), klasifikasi, dan pengelompokan.
  • Tersedia sebagai model terbuka melalui Hugging Face.