저자는 GPU 계산 바운드와 입력 바운드 학습 성능 문제를 구분하는 데 도움을 주기 위해 오픈 소스 PyTorch 관측성 프로젝트인 TraceML에 진단 도구를 통합했습니다. 이 새로운 기능은 낮은 GPU 활용률이 느린 데이터 로딩 때문인지 실제 모델 계산 한계 때문인지 개발자가 빠르게 식별할 수 있게 합니다.
- 통합으로 Hugging Face `Trainer` 에 `TraceMLTrainerCallback` 이 추가되어 최소한의 설정 변경만 필요합니다.
- 입력 대기 시간을 단계 작업과 분리하여 병목 현상 유형에 대한 실용적인 판단을 제공합니다.
- ResNet-50 을 사용한 Colab 예제는 DataLoader 설정을 조정함으로써 진단이 입력 바운드에서 계산 바운드로 변경되고 속도가 1.83 배 향상되었음을 보여주었습니다.
이 도구는 학습 실행에 영향을 미치는 특정 제약 조건을 명확히 함으로써 사용자가 잘못된 구성 요소를 최적화하는 것을 방지하는 데 도움을 줍니다.