TraceML, una herramienta de diagnóstico de entrenamiento de PyTorch de código abierto, se utilizó para reproducir una regresión conocida en el entrenamiento de LeRobot y medir el impacto del parche upstream #2408. El análisis reveló que, aunque la mayoría de las obtenciones del DataLoader eran rápidas, las obtenciones recurrentes anteriormente tardaban más de cinco segundos.
- El tiempo por paso disminuyó de aproximadamente 1500ms a 117ms después del parche.
- El tiempo de obtención del CPU DataLoader cayó de ~1375ms a 1.5ms en el primer par y de ~1427ms a 1.3ms en el segundo par.
- El tiempo de cómputo se mantuvo estable alrededor de 110–116ms, confirmando que la carga de trabajo cambió de INPUT-BOUND a COMPUTE-BOUND.
La herramienta ayuda a identificar dónde se pierde tiempo adicional cuando el entrenamiento se ralentiza después de un cambio, instrumentando el bucle de entrenamiento y comparando los tiempos entre dos ejecuciones.