Google DeepMindはGemma 3の技術レポートを公開し、10億〜270億パラメータの軽量オープンモデルファミリーGemmaにマルチモーダルアップデートをもたらしました。このバージョンでは視覚理解が追加され、少なくとも128Kトークンのコンテキストをサポートし、KV-cacheメモリ使用量を削減するためにアーキテクチャが変更されました。
- モデルアーキテクチャはローカルアテンション層とグローバルアテンション層の比率を増やし、長いコンテキストメモリを管理するためにローカルアテンションスパンを短く保ちます。
- 学習には蒸留が利用され、数学、チャット、指示フォロー、多言語能力を大幅に向上させる新しいポストトレーニングレシピが採用されています。
- Gemma3-4B-ITはGemma2-27B-ITと同等のパフォーマンスを実現し、Gemma3-27B-ITはベンチマークでGemini-1.5-Proと競合しています。
著者はすべてのモデルをコミュニティに公開し、事前学習および指示ファインチューニングの両方のアプリケーションにおいて、以前のバージョンを上回るパフォーマンスを提供することを目指しています。