O autor desenvolveu o metrictrust, uma ferramenta Python leve que monitora execuções de treinamento para determinar se as métricas finais de validação devem ser confiáveis. Ela aborda problemas comuns, como manter checkpoints subótimos, superestimar o desempenho devido à memorização e confiar em resultados oscilantes e ruidosos.

  • Fornece um veredito em linguagem simples de 'confiar', 'cautela' ou 'não confiar' com base na dinâmica do treinamento.
  • Detecta quando a melhor métrica ocorreu no meio do treinamento, mas não foi salva como o checkpoint final.
  • Identifica casos em que a precisão do treinamento excede significativamente a precisão da avaliação, indicando memorização.
  • Sinaliza execuções com alta oscilação para alertar contra tratar uma única amostra ruidosa como uma medição confiável.
  • Funciona com o HuggingFace Trainer por meio do TrustCheckCallback ou qualquer loop personalizado via TrustMonitor.

A ferramenta ajuda os usuários a evitar tirar conclusões incorretas dos números finais dos logs, destacando quando o pico de desempenho do modelo foi perdido ou quando os dados são instáveis demais para serem significativos.