Google和Google DeepMind推出了Gemini 1.0,这是一个新的超大规模多模态模型家族,旨在原生地理解和结合文本、代码、音频、图像和视频。
- 第一个版本包括三种优化尺寸:用于复杂任务的Gemini Ultra、用于跨任务扩展的Gemini Pro以及用于设备端效率的Gemini Nano。
- Gemini Ultra在32个广泛使用的学术基准中的30个上取得了最先进的性能,并且是第一个在MMLU上以90.0%的成绩超越人类专家模型。
- 这些模型从底层构建为多模态,使它们能够推理多样化的输入,而无需依赖拼接在一起的单独组件。
此次发布标志着构建通用AI的重要一步,这种AI可以增强开发者和企业构建和扩展应用程序的方式。