Google DeepMind ने EmbeddingGemma 2 जारी किया है, जो Gemma 4 आर्किटेक्चर पर बना एक ओपन-सोर्स बहु-मोडल एम्बेडिंग मॉडल है जो टेक्स्ट, कोड, छवियों, वीडियो और ऑडियो को एक साझा 768-आयामी वेक्टर स्पेस में एम्बेड करता है। इस मॉडल में 740 मिलियन पैरामीटर हैं, जिनमें एक मॉड्यूलर डिज़ाइन है जो छोटे केवल-टेक्स्ट या विजन-ऑडियो वैरिएंट की अनुमति देता है, और यह 8K टोकन संदर्भ खिड़की का समर्थन करता है।
- EmbeddingGemma 2 ने 1B से कम बहु-मोडल एम्बेडर्स में शीर्ष स्कोर हासिल किए हैं, जिसमें MTEB Code v1 पर 78.68 और MAEB (ऑडियो) पर 49.39 शामिल हैं।
- मॉडल को डिवाइस पर तैनाती के लिए अनुकूलित किया गया है, जिसके लिए केवल-टेक्स्ट वजन के लिए लगभग 191MB RAM और पूरे बहु-मोडल मॉडल के लिए Pixel 11 Pro पर 567MB की आवश्यकता होती है।
- यह वेक्टर को 512, 256 या 128 आयामों तक काटने की अनुमति देने के लिए Matryoshka Representation Learning का उपयोग करता है, जिससे न्यूनतम प्रदर्शन हानि के साथ भंडारण आवश्यकताओं में काफी कमी आती है।
- वजन Hugging Face और Kaggle पर Apache 2.0 लाइसेंस के तहत उपलब्ध हैं, जिसमें Ollama, llama.cpp, LiteRT और अन्य फ्रेमवर्क्स का समर्थन किया जाता है।
यह रिलीज़ डेवलपर्स को क्लाउड पर डेटा भेजे बिना सीधे डिवाइस पर एम्बेडिंग्स चलाने की अनुमति देकर प्राइवेसी-फर्स्ट रिट्रीवल-एगमेंटेड जनरेशन (RAG) और स्थानीय खोज क्षमताओं को सक्षम बनाती है।