Trase garantiu a posição número um no benchmark GAIA do Hugging Face, um teste que mede capacidades reais de agentes de IA, incluindo raciocínio e uso de ferramentas, superando submissões da Meta, Microsoft e outros.
- Trase alcançou uma taxa de sucesso geral de 35.55% no benchmark com mais de 450 perguntas.
- O sistema usa autoaperfeiçoamento iterativo via STaR (Self-Taught Reasoner) ajustado finamente em trajetórias de ações semelhantes às humanas.
- Ele aumenta as ações base do LLM com código para compor múltiplas chamadas de ferramentas em uma única ação de código.
- Um agente de nível superior realiza auto-crítica para determinar se informações suficientes foram reunidas antes de alternar ferramentas ou chamar agentes especializados.
O artigo nota que 90% proficiency é considerado o limiar para substituir humanos em tarefas complexas, um objetivo que o Trase visa alcançar.