Trase ha asegurado la posición número uno en el benchmark GAIA de Hugging Face, una prueba que mide las capacidades reales de los agentes de IA, incluyendo razonamiento y uso de herramientas, superando a las presentaciones de Meta, Microsoft y otros.

  • Trase logró una tasa de éxito general del 35.55% en el benchmark de más de 450 preguntas.
  • El sistema utiliza auto-mejora iterativa mediante STaR (Self-Taught Reasoner) ajustado finamente sobre trayectorias de acciones similares a las humanas.
  • Aumenta las acciones base del LLM con código para componer múltiples llamadas de herramientas en una sola acción de código.
  • Un agente de nivel superior realiza auto-crítica para determinar si se ha reunido información suficiente antes de cambiar de herramienta o llamar a agentes especializados.

El artículo señala que el 90% de proficiency se considera el umbral para reemplazar humanos en tareas complejas, un objetivo al que Trase aspira.