Google DeepMind ने Gemma 3 तकनीकी रिपोर्ट जारी की है, जिसमें 1 से 27 अरब पैरामीटर तक के हल्के ओपन मॉडल परिवार Gemma के लिए एक बहुआयामी अपडेट पेश किया गया है। इस संस्करण में विज़न समझ जोड़ी गई है, कम से कम 128K टोकन के कॉन्टेक्स्ट का समर्थन करता है और KV-cache मेमोरी उपयोग को कम करने के लिए आर्किटेक्चर में बदलाव किया गया है।
- मॉडल आर्किटेक्चर स्थानीय से वैश्विक एटेंशन परतों के अनुपात को बढ़ाता है और लॉग-कॉन्टेक्स्ट मेमोरी को प्रबंधित करने के लिए स्थानीय एटेंशन स्पैन को छोटा रखता है।
- प्रशिक्षण में डिस्टिलेशन का उपयोग किया जाता है, जिसमें एक नवीन पोस्ट-ट्रेनिंग रेसिपी है जो गणित, चैट, निर्देश-अनुपालन और बहुभाषी क्षमताओं को काफी बढ़ाती है।
- Gemma3-4B-IT का प्रदर्शन Gemma2-27B-IT के तुलनीय है, जबकि Gemma3-27B-IT बेंचमार्क्स में Gemini-1.5-Pro के प्रतिस्पर्धी है।
लेखकों ने सभी मॉडल को समुदाय के लिए जारी किए हैं, जिसका उद्देश्य पूर्व-प्रशिक्षित और निर्देश-फाइन-ट्यूंड अनुप्रयोगों दोनों के लिए पिछले संस्करणों की तुलना में श्रेष्ठ प्रदर्शन प्रदान करना है।