트레이스가 허깅페이스 GAIA 리더보드에서 최상위 자리를 되찾았으며, 공개된 테스트 점수는 약 67%, 검증 점수는 70.3%를 기록했다. 이 성능은 쿼리당 비용이 약 1/100 수준으로 Google, Microsoft, OpenAI 같은 업계 거물들을 제쳤다.
- 트레이스는 GAIA 벤치마크에서 전체 테스트 점수 66.78%를 달성했으며, 이는 다단계 추론, 멀티모달 데이터 처리 및 도구 사용을 평가한다.
- 시스템은 쿼리당 약 $10의 컴퓨팅 파워를 사용했으며, OpenAI의 Deep Research는 질문당 $1,100에서 $1,300 사이가 들었다.
- 트레이스는 대부분의 질문에 단 한 번의 패스로 답변하는 반면, Deep Research 같은 경쟁사들은 점수를 집계하기 위해 질문당 64번의 시도가 필요했다.
- 이 플랫폼은 헬스케어와 금융 같은 분야에서 정확성과 규정 준수를 보장하기 위해 산업별 데이터에 대한 파인튜닝과 결과 감독 강화 학습을 활용한다.
트레이스의 모델 비종속 아키텍처는 조직이 광범위한 IT 팀이나 고가의 인프라 없이도 안전하고 확장 가능한 AI 에이전트를 배포할 수 있게 한다.