Googleは、10億から270億パラメータの軽量なオープンマルチモーダルモデルの新シリーズであるGemma 3を発表しました。このアップデートでは、以前のバージョンと比較して、ビジョン理解機能、少なくとも128Kトークンのコンテキストサポート、および拡張された多言語カバーレッジが追加されています。
- モデルは、柔軟な画像解像度に対応するためのPan & Scanメソッドを備えた専用SigLIPビジョンエンコーダーを利用しています。
- アーキテクチャの変更には、長文コンテキスト推論時のKVキャッシュメモリ使用量を削減するために、ローカルからグローバルの注意層まで5:1のインターリーブが含まれています。
- 1Bモデルは32Kのコンテキストをサポートし、より大きなモデルは128Kトークンをサポートします。
- トレーニングには、Geminiフロンティアモデルからの知識蒸留と新しいポストトレーニングレシピが採用されています。
- Gemma3-4B-ITはGemma2-27B-ITのパフォーマンスに匹敵し、Gemma3-27B-ITはベンチマークにおいてGemini-1.5-Proと比較可能な性能を示しています。
今回のリリースにより、すべてのモデルバリアントがコミュニティに提供され、標準的なコンシューマーグレードのハードウェア上で強力なマルチモーダル機能を実現可能にしました。