Trase a sécurisé la première position sur le benchmark GAIA de Hugging Face, un test mesurant les capacités réelles des agents IA, y compris le raisonnement et l'utilisation d'outils, surpassant les soumissions de Meta, Microsoft et autres.
- Trase a atteint un taux de réussite global de 35.55% sur le benchmark de plus de 450 questions.
- Le système utilise une auto-amélioration itérative via STaR (Self-Taught Reasoner) ajusté finement sur des trajectoires d'actions similaires aux humaines.
- Il augmente les actions de base du LLM avec du code pour composer plusieurs appels d'outils en une seule action de code.
- Un agent de niveau supérieur effectue une auto-critique pour déterminer si suffisamment d'informations ont été rassemblées avant de changer d'outil ou d'appeler des agents spécialisés.
L'article note que 90% proficiency est considéré comme le seuil pour remplacer les humains dans des tâches complexes, un objectif que Trase vise à atteindre.