구글은 10억 개에서 270억 개의 파라미터에 이르는 경량의 오픈 멀티모달 모델 신제품군인 Gemma 3을 소개합니다. 이번 업데이트는 이전 버전 대비 시각 이해 기능, 최소 128K 토큰의 컨텍스트 지원, 그리고 확장된 다국어 커버리지를 추가합니다.
- 모델은 유연한 이미지 해상도를 위한 Pan & Scan 방식과 맞춤형 SigLIP 비전 인코더를 활용합니다.
- 아키텍처 변경 사항에는 긴 컨텍스트 추론 중 KV-cache 메모리 사용을 줄이기 위해 로컬 어텐션 레이어와 글로벌 어텐션 레이어를 5:1로 인터リーブ한 것이 포함됩니다.
- 1B 모델은 32K 컨텍스트를 지원하며, 더 큰 모델들은 128K 토큰을 지원합니다.
- 학습은 Gemini 프론티어 모델로부터의 지식 증류와 새로운 사후 학습 레시피를 사용합니다.
- Gemma3-4B-IT는 Gemma2-27B-IT 성능과 동급이며, Gemma3-27B-IT는 벤치마크에서 Gemini-1.5-Pro와 비교 가능합니다.
이번 출시로 모든 모델 변형이 커뮤니티에 제공되어 일반 소비자용 하드웨어에서도 강력한 멀티모달 기능을 활용할 수 있게 되었습니다.