GoogleとGoogle DeepMindは、テキスト、コード、音声、画像、ビデオをネイティブに理解し統合するための大規模マルチモーダルモデルの新ファミリーであるGemini 1.0を発表しました。

  • 最初のバージョンには3つの最適化されたサイズが含まれています:複雑なタスク用のGemini Ultra、タスク間のスケーリング用のGemini Pro、およびデバイス上の効率性のためのGemini Nano。
  • Gemini Ultraは、広く使用されている32の学術ベンチマークのうち30で最先端のパフォーマンスを達成し、MMLUで人間专家を超えた最初のモデルとなりました(スコア90.0%)。
  • これらのモデルは最初からマルチモーダルとして構築されており、個別に結合されたコンポーネントに依存せずに多様な入力を推論できます。

このリリースは、開発者や企業がアプリケーションを構築・スケーリングする方法を強化できる汎用AIの構築における重要な一歩を表しています。