Traseは、推論やツール使用を含む現実世界のAIエージェントの能力を測定するテストであるHugging FaceのGAIAベンチマークで1位を獲得し、Meta、Microsoftなどの提出物を上回りました。

  • Traseは450以上の質問を持つベンチマークで35.55%の総合成功率を達成しました。
  • システムは人間のような行動軌道でファインチューニングされたSTaR(Self-Taught Reasoner)を通じて反復的自己改善を行います。
  • 複数のツール呼び出しを単一のコードアクションにcomposeするために、基本LLMのアクションをコードで拡張します。
  • トップレベルのエージェントは、ツールを切り替えるか専門エージェントを呼び出す前に十分な情報が収集されたかどうかを判断するために自己批判を行います。

記事では、複雑なタスクで人間を置き換えるための閾値として90% proficiencyが考慮されていると述べられており、Traseはこの目標を目指しています。