Google推出了Gemini 2.5,这是其最新的“思维”AI模型系列,能够在回应之前通过思考进行推理。首次发布的是Gemini 2.5 Pro的实验版本,该模型在广泛的基准测试中取得了最先进的性能,并在LMArena排行榜上位居第一。

  • Gemini 2.5 Pro以显著优势领先LMArena排行榜,表明其具有高质量的风格和能力。
  • 在不使用多数投票等测试时技术的情况下,它在GPQA和AIME 2025等数学和科学基准测试中处于领先地位。
  • 该模型在Humanity’s Last Exam(一个捕捉人类知识前沿的数据集)上取得了18.8%的当前最高分。
  • 在SWE-Bench Verified上,Gemini 2.5 Pro在使用自定义智能体设置进行智能体代码评估时得分为63.8%。
  • 它拥有100万token的上下文窗口,即将推出200万token的版本,支持文本、音频、图像、视频和代码仓库。

Gemini 2.5 Pro现已在Google AI Studio和Advanced用户的Gemini应用中提供,预计Vertex AI将在未来几周内可用。