أصدرت Google DeepMind التقرير التقني لـ Gemma 3، مقدمةً تحديثًا متعدد الوسائط لعائلة النماذج المفتوحة الخفيفة Gemma التي تتراوح من 1 إلى 27 مليار معامل. تضيف هذه النسخة فهم الرؤية، وتدعم ما لا يقل عن 128K رمزًا للسياق، وتعدّل البنية لتقليل استخدام ذاكرة KV-cache.
- تزيد بنية النموذج من نسبة طبقات الانتباه المحلي إلى العالمي وتحافظ على نطاقات الانتباه المحلي قصيرة لإدارة ذاكرة السياق الطويل.
- يستخدم التدريب التقني (distillation)، مع وصفة تدريب لاحقة جديدة تعزز بشكل كبير القدرات الرياضية، والدردشة، واتباع التعليمات، والمتعددة اللغات.
- يحقق Gemma3-4B-IT أداءًComparable لـ Gemma2-27B-IT، بينما يكون Gemma3-27B-IT منافسًا لـ Gemini-1.5-Pro عبر الاختبارات المرجعية.
يقوم المؤلفون بإطلاق جميع النماذج للمجتمع، بهدف توفير أداء متفوق على الإصدارات السابقة لكل من التطبيقات المدربة مسبقًا والمعدّلة بالتعليمات.