Trase занял первое место в бенчмарке GAIA от Hugging Face, тесте, измеряющем способности реальных AI-агентов, включая рассуждение и использование инструментов, превзойдя результаты submissions от Meta, Microsoft и других.
- Trase достиг общей успешности 35.55% на бенчмарке с более чем 450 вопросами.
- Система использует итеративное самосовершенствование через STaR (Self-Taught Reasoner), дообученный на траекториях действий, похожих на человеческие.
- Она дополняет базовые действия LLM кодом для композиции нескольких вызовов инструментов в одно код-действие.
- Агент верхнего уровня выполняет самокритику, чтобы определить, собрана ли достаточная информация, прежде чем переключать инструменты или вызывать специализированные агенты.
В статье отмечается, что 90% proficiency считается порогом для замены людей в сложных задачах, к чему стремится Trase.