Google y Google DeepMind han presentado Gemini 1.0, una nueva familia de modelos multimodales a gran escala diseñados para comprender y combinar texto, código, audio, imagen y video de forma nativa.
- La primera versión incluye tres tamaños optimizados: Gemini Ultra para tareas complejas, Gemini Pro para escalar en tareas y Gemini Nano para eficiencia en el dispositivo.
- Gemini Ultra logra un rendimiento de vanguardia en 30 de los 32 benchmarks académicos más utilizados y es el primer modelo en superar a expertos humanos en MMLU con una puntuación de 90.0%.
- Los modelos están construidos desde cero para ser multimodales, permitiéndoles razonar sobre entradas diversas sin depender de componentes separados cosidos juntos.
Este lanzamiento representa un paso significativo en la construcción de IA de propósito general que puede mejorar cómo los desarrolladores y las empresas crean y escalan aplicaciones.