L'auteur a développé metrictrust, un outil Python léger qui surveille les exécutions d'entraînement pour déterminer si les métriques de validation finales doivent être prises au sérieux. Il traite des problèmes courants tels que la conservation de points de contrôle sous-optimaux, la surestimation des performances due à la mémorisation et la dépendance à des résultats bruités et oscillants.
- Fournit un verdict en langage clair de 'fiable', 'prudence' ou 'non-fiable' basé sur la dynamique d'entraînement.
- Détecte quand la meilleure métrique s'est produite au milieu de l'entraînement mais n'a pas été sauvegardée comme point de contrôle final.
- Identifie les cas où la précision d'entraînement dépasse significativement la précision d'évaluation, indiquant une mémorisation.
- Signale les exécutions avec une forte oscillation pour avertir de ne pas traiter un seul échantillon bruité comme une mesure fiable.
- Fonctionne avec HuggingFace Trainer via TrustCheckCallback ou n'importe quelle boucle personnalisée via TrustMonitor.
L'outil aide les utilisateurs à éviter de tirer des conclusions incorrectes à partir des chiffres finaux des journaux en mettant en évidence quand le pic de performance du modèle a été manqué ou lorsque les données sont trop instables pour être significatives.