Google DeepMind 发布了 Gemma 3 技术报告,对 Gemma 轻量级开源模型系列(参数规模从 10 亿到 270 亿)进行了多模态更新。此版本增加了视觉理解能力,支持至少 128K token 的上下文,并修改了架构以降低 KV-cache 内存占用。
- 模型架构增加了局部注意力层与全局注意力层的比例,并保持局部注意力跨度较短,以管理长上下文内存。
- 训练利用蒸馏技术,采用了一种新颖的训练后配方,显著增强了数学、聊天、指令遵循和多语言处理能力。
- Gemma3-4B-IT 的性能可与 Gemma2-27B-IT 相媲美,而 Gemma3-27B-IT 在基准测试中与 Gemini-1.5-Pro 具有竞争力。
作者将所有模型发布给社区,旨在为预训练和指令微调应用提供优于前代的性能。