Google推出Gemma 3,这是一个全新的轻量级开源多模态模型家族,参数量从10亿到270亿不等。此次更新增加了视觉理解能力,支持至少128K token的上下文,并扩展了多语言覆盖范围,相比之前的版本有所改进。
- 模型采用定制的SigLIP视觉编码器,并结合Pan & Scan方法以支持灵活的图像分辨率。
- 架构变更包括将局部注意力层与全局注意力层按5:1交错排列,以减少长上下文推理期间的KV-cache内存占用。
- 1B模型支持32K上下文,而更大的模型支持128K token。
- 训练过程采用来自Gemini前沿模型的知识蒸馏以及一种新颖的后期训练配方。
- Gemma3-4B-IT在性能上匹配Gemma2-27B-IT,而Gemma3-27B-IT在基准测试中与Gemini-1.5-Pro相当。
此次发布向社区提供了所有模型变体,使得在标准消费级硬件上实现强大的多模态能力成为可能。