Google DeepMind 宣布对其 Gemini 2.5 模型系列进行重大更新,引入了推理、音频交互和开发者控制方面的新功能。此次更新包括为 2.5 Pro 推出的实验性“Deep Think”模式、原生音频输出功能,以及通过 Project Mariner 扩展的计算机操作能力。
- Gemini 2.5 Pro 现已领跑 WebDev Arena 和 LMArena 排行榜,并基于教育专家评估成为学习领域的顶级模型。
- 新的“Deep Think”模式允许 2.5 Pro 考虑多种假设,在 USAMO 和 LiveCodeBench 基准测试中取得高分。
- Gemini 2.5 Flash 现在效率更高,在推理、多模态和编码基准测试中性能提升的同时,使用的 token 减少了 20-30%。
- 原生音频输出支持通过语调引导、情绪检测和多人语音合成(超过 24 种语言)实现对话式体验。
- Project Mariner 的计算机操作功能正在集成到 Gemini API 和 Vertex AI 中,以便更广泛地进行开发者实验。
- 增强的安全保护措施可防止间接提示注入,使 Gemini 2.5 成为迄今为止最安全的模型系列。
- 开发者工具现在包括用于透明度的思维摘要、用于成本控制的扩展思考预算以及用于开源工具集成的原生 MCP 支持。
这些更新旨在为开发者提供更透明、可控且功能强大的工具以构建复杂应用,同时提升 Gemini 生态系统的安全性和效率。