Trase garantiu a posição número um no benchmark GAIA do Hugging Face, um teste que mede capacidades reais de agentes de IA, incluindo raciocínio e uso de ferramentas, superando submissões da Meta, Microsoft e outros.

  • Trase alcançou uma taxa de sucesso geral de 35.55% no benchmark com mais de 450 perguntas.
  • O sistema usa autoaperfeiçoamento iterativo via STaR (Self-Taught Reasoner) ajustado finamente em trajetórias de ações semelhantes às humanas.
  • Ele aumenta as ações base do LLM com código para compor múltiplas chamadas de ferramentas em uma única ação de código.
  • Um agente de nível superior realiza auto-crítica para determinar se informações suficientes foram reunidas antes de alternar ferramentas ou chamar agentes especializados.

O artigo nota que 90% proficiency é considerado o limiar para substituir humanos em tarefas complexas, um objetivo que o Trase visa alcançar.