Trase ha asegurado la posición número uno en el benchmark GAIA de Hugging Face, una prueba que mide las capacidades reales de los agentes de IA, incluyendo razonamiento y uso de herramientas, superando a las presentaciones de Meta, Microsoft y otros.
- Trase logró una tasa de éxito general del 35.55% en el benchmark de más de 450 preguntas.
- El sistema utiliza auto-mejora iterativa mediante STaR (Self-Taught Reasoner) ajustado finamente sobre trayectorias de acciones similares a las humanas.
- Aumenta las acciones base del LLM con código para componer múltiples llamadas de herramientas en una sola acción de código.
- Un agente de nivel superior realiza auto-crítica para determinar si se ha reunido información suficiente antes de cambiar de herramienta o llamar a agentes especializados.
El artículo señala que el 90% de proficiency se considera el umbral para reemplazar humanos en tareas complejas, un objetivo al que Trase aspira.