أصدرت Google DeepMind التقرير التقني لـ Gemma 3، مقدمةً تحديثًا متعدد الوسائط لعائلة النماذج المفتوحة الخفيفة Gemma التي تتراوح من 1 إلى 27 مليار معامل. تضيف هذه النسخة فهم الرؤية، وتدعم ما لا يقل عن 128K رمزًا للسياق، وتعدّل البنية لتقليل استخدام ذاكرة KV-cache.

  • تزيد بنية النموذج من نسبة طبقات الانتباه المحلي إلى العالمي وتحافظ على نطاقات الانتباه المحلي قصيرة لإدارة ذاكرة السياق الطويل.
  • يستخدم التدريب التقني (distillation)، مع وصفة تدريب لاحقة جديدة تعزز بشكل كبير القدرات الرياضية، والدردشة، واتباع التعليمات، والمتعددة اللغات.
  • يحقق Gemma3-4B-IT أداءًComparable لـ Gemma2-27B-IT، بينما يكون Gemma3-27B-IT منافسًا لـ Gemini-1.5-Pro عبر الاختبارات المرجعية.

يقوم المؤلفون بإطلاق جميع النماذج للمجتمع، بهدف توفير أداء متفوق على الإصدارات السابقة لكل من التطبيقات المدربة مسبقًا والمعدّلة بالتعليمات.