Trase занял первое место в бенчмарке GAIA от Hugging Face, тесте, измеряющем способности реальных AI-агентов, включая рассуждение и использование инструментов, превзойдя результаты submissions от Meta, Microsoft и других.

  • Trase достиг общей успешности 35.55% на бенчмарке с более чем 450 вопросами.
  • Система использует итеративное самосовершенствование через STaR (Self-Taught Reasoner), дообученный на траекториях действий, похожих на человеческие.
  • Она дополняет базовые действия LLM кодом для композиции нескольких вызовов инструментов в одно код-действие.
  • Агент верхнего уровня выполняет самокритику, чтобы определить, собрана ли достаточная информация, прежде чем переключать инструменты или вызывать специализированные агенты.

В статье отмечается, что 90% proficiency считается порогом для замены людей в сложных задачах, к чему стремится Trase.