Google 发布了 Gemini 2.5 Pro 的实验版本,这是其最先进的思维模型,专为复杂任务和增强的推理能力而设计。该模型以显著优势登顶 LMArena 排行榜,并在各种基准测试中展现出最先进的性能。

  • 凭借高质量的风格和强大的推理能力位居 LMArena 排行榜榜首。
  • 在没有使用测试时技术的情况下,在 GPQA 和 AIME 2025 等数学和科学基准测试中领先。
  • 在 Humanity’s Last Exam 中获得 18.8% 的分数,捕捉到了人类知识的边界。
  • 在用于代理代码评估的 SWE-Bench Verified 上达到 63.8%。
  • 拥有 100 万 token 的上下文窗口,并原生支持多模态。

该模型现已在 Google AI Studio 和 Gemini 应用中面向高级用户开放,Vertex AI 集成和定价细节预计将在未来几周内公布。