저자는 metrictrust라는 경량 Python 도구를 개발했으며, 이 도구는 최종 검증 지표를 신뢰할 수 있는지 판단하기 위해 학습 과정을 모니터링합니다. 이는 하위 최적 체크포인트를 유지하거나, 암기로 인해 성능을 과대평가하거나, 노이즈가 많은 진동 결과를 의존하는 것과 같은 일반적인 문제를 해결합니다.

  • 학습 동역학에 기반하여 'trust', 'caution', 'do-not-trust'라는 평이한 언어의 판정을 제공합니다.
  • 최적의 지표가 학습 중간에 발생했지만 최종 체크포인트로 저장되지 않았을 때 감지합니다.
  • 훈련 정확도가 평가 정확도를 크게 상회하는 경우를 식별하여 암기를 나타냅니다.
  • 높은 진동을 보이는 실행을 플래그 처리하여 단일 노이즈 샘플을 신뢰할 수 있는 측정값으로 간주하지 않도록 경고합니다.
  • TrustCheckCallback을 통해 HuggingFace Trainer와 함께 작동하거나, TrustMonitor를 통해 사용자 정의 루프에서 작동합니다.

이 도구는 모델의 최고 성능이 놓쳤거나 데이터가 의미 있을 만큼 안정적이지 않을 때 강조 표시함으로써 최종 로그 숫자로부터 잘못된 결론을 내리는 것을 방지하는 데 도움이 됩니다.