H2O.ai объявляет, что её агент h2oGPTe занял первое место в бенчмарке General AI Assistants (GAIA), достигнув точности 75%. Этот результат стал первым достижением оценки C на тестовом наборе GAIA и выводит агента вперёд по сравнению с Deep Research от OpenAI, сопоставляясь по производительности с Manus.
- Агент использует Claude 3.7 Sonnet от Anthropic со специализированным режимом рассуждений для сложных аналитических задач.
- Новые возможности включают продвинутую навигацию в браузере, объединённый поиск по нескольким движкам, таким как Google и Bing, а также интеграцию с GitHub для разработки программного обеспечения.
- H2O.ai подчёркивает, что её результаты основаны на тестовом наборе GAIA, а не на валидационном, указывая на возможное загрязнение данных в последнем.
- Платформа теперь включает прямое указание источников и встроенные цитаты ответов для повышения прозрачности.
Достижение подтверждает подход H2O.ai к созданию ИИ-ассистентов, способных решать реальные задачи, требующие рассуждений, мультимодальности и использования инструментов.