O autor desenvolveu o metrictrust, uma ferramenta Python leve que monitora execuções de treinamento para determinar se as métricas finais de validação devem ser confiáveis. Ela aborda problemas comuns, como manter checkpoints subótimos, superestimar o desempenho devido à memorização e confiar em resultados oscilantes e ruidosos.
- Fornece um veredito em linguagem simples de 'confiar', 'cautela' ou 'não confiar' com base na dinâmica do treinamento.
- Detecta quando a melhor métrica ocorreu no meio do treinamento, mas não foi salva como o checkpoint final.
- Identifica casos em que a precisão do treinamento excede significativamente a precisão da avaliação, indicando memorização.
- Sinaliza execuções com alta oscilação para alertar contra tratar uma única amostra ruidosa como uma medição confiável.
- Funciona com o HuggingFace Trainer por meio do TrustCheckCallback ou qualquer loop personalizado via TrustMonitor.
A ferramenta ajuda os usuários a evitar tirar conclusões incorretas dos números finais dos logs, destacando quando o pico de desempenho do modelo foi perdido ou quando os dados são instáveis demais para serem significativos.