Trase는 추론 및 도구 사용 등 실제 세계 AI 에이전트 능력을 측정하는 테스트인 Hugging Face의 GAIA 벤치마크에서 1위를 차지했으며, Meta, Microsoft 등의 제출물을 압도했습니다.

  • Trase는 450개 이상의 질문을 가진 벤치마크에서 35.55%의 전체 성공률을 달성했습니다.
  • 시스템은 인간 유사 행동 궤적에 파인튜닝된 STaR(Self-Taught Reasoner)를 통해 반복적 자기 개선(iterative self-improvement)을 사용합니다.
  • 기본 LLM 행동을 코드로 보강하여 여러 도구 호출을 단일 코드 액션으로 compose합니다.
  • 최상위 에이전트는 도구를 전환하거나 전문 에이전트를 호출하기 전에 충분한 정보가 수집되었는지 결정하기 위해 자기 비판(self-critique)을 수행합니다.

기사는 복잡한 작업에서 인간을 대체하기 위한 임계값으로 90% proficiency가 고려된다고 언급하며, Trase는 이 목표에 도달하기를 목표로 합니다.