H2O.ai anuncia que su agente h2oGPTe ha alcanzado la posición #1 en el benchmark General AI Assistants (GAIA), logrando una tasa de precisión del 75%. Este resultado marca la primera vez que se alcanza una calificación de C en el conjunto de pruebas GAIA y coloca al agente por delante de Deep Research de OpenAI, igualando el rendimiento de Manus.
- El agente utiliza Claude 3.7 Sonnet de Anthropic con un modo de razonamiento especializado para tareas analíticas complejas.
- Las nuevas capacidades incluyen navegación avanzada en el navegador, búsqueda unificada en múltiples motores como Google y Bing, e integración con GitHub para ingeniería de software.
- H2O.ai enfatiza que sus resultados se basan en el conjunto de pruebas GAIA en lugar del conjunto de validación, citando una posible contaminación de datos en este último.
- La plataforma ahora incluye atribución de fuentes en tiempo real y citas de respuestas en línea para mejorar la transparencia.
El logro valida el enfoque de H2O.ai para crear asistentes de IA capaces de manejar tareas del mundo real que requieren razonamiento, multimodalidad y uso de herramientas.