Googleは、回答前に思考を通じて推論を行うことができる最新の「思考」AIモデルファミリーであるGemini 2.5を発表しました。最初のリリースは実験的なバージョンのGemini 2.5 Proで、幅広いベンチマークで最先端のパフォーマンスを達成し、LMArenaリーダーボードで1位に初登場しています。
- Gemini 2.5 ProはLMArenaリーダーボードで大幅な差をつけて首位に立ち、高品質なスタイルと能力を示しています。
-多数決投票などのテスト時の手法を使用せずに、GPQAやAIME 2025などの数学および科学ベンチマークでリードしています。 -人間の知識の最前線を捉えたデータセットであるHumanity’s Last Examで、最先端となる18.8%のスコアを記録しました。 -SWE-Bench Verifiedでは、エージェント型コード評価用のカスタムエージェント設定により63.8%のスコアを獲得しました。 -100万トークンのコンテキストウィンドウを搭載しており、200万トークンもまもなく提供されます。テキスト、オーディオ、画像、動画、コードリポジトリをサポートします。
Gemini 2.5 Proは現在、Google AI StudioおよびAdvancedユーザー向けのGeminiアプリで利用可能であり、Vertex AIでの利用は数週間以内に開始される予定です。