O TraceML, uma ferramenta de diagnóstico de treinamento do PyTorch de código aberto, foi usada para reproduzir uma regressão conhecida no treinamento do LeRobot e medir o impacto da correção upstream #2408. A análise revelou que, embora a maioria das buscas do DataLoader fosse rápida, as buscas recorrentes anteriormente levavam mais de cinco segundos.

  • O tempo por etapa diminuiu de aproximadamente 1500ms para 117ms após a correção.
  • O tempo de busca do CPU DataLoader caiu de ~1375ms para 1.5ms no primeiro par e de ~1427ms para 1.3ms no segundo par.
  • O tempo de computação permaneceu estável em torno de 110–116ms, confirmando que a carga de trabalho mudou de INPUT-BOUND para COMPUTE-BOUND.

A ferramenta ajuda a identificar onde o tempo extra é gasto quando o treinamento desacelera após uma alteração, instrumentando o loop de treinamento e comparando os tempos entre duas execuções.