L'auteur a intégré un outil de diagnostic dans TraceML, un projet d'observabilité PyTorch open-source, pour aider les utilisateurs à distinguer les problèmes de performance d'entraînement limités par le calcul GPU et ceux limités par l'entrée. Cette nouvelle fonctionnalité permet aux développeurs d'identifier rapidement si une faible utilisation du GPU est causée par un chargement lent des données ou par des limites réelles de calcul du modèle.

  • L'intégration ajoute un `TraceMLTrainerCallback` au `Trainer` de Hugging Face, nécessitant des modifications minimales de configuration.
  • Elle sépare le temps d'attente de l'entrée du travail de l'étape pour fournir un verdict pratique sur le type de goulot d'étranglement.
  • Un exemple dans Colab avec ResNet-50 a démontré que l'ajustement des paramètres de DataLoader a changé le diagnostic de limité par l'entrée à limité par le calcul et a amélioré la vitesse de 1.83×.

Cet outil aide les utilisateurs à éviter d'optimiser le mauvais composant en clarifiant la contrainte spécifique qui affecte leurs exécutions d'entraînement.