El autor desarrolló metrictrust, una herramienta ligera en Python que monitorea las ejecuciones de entrenamiento para determinar si las métricas finales de validación deben ser confiables. Aborda problemas comunes como conservar puntos de control subóptimos, sobreestimar el rendimiento debido a la memorización y depender de resultados oscilantes y ruidosos.
- Proporciona un veredicto en lenguaje claro de 'confiar', 'precaución' o 'no confiar' basado en la dinámica del entrenamiento.
- Detecta cuándo la mejor métrica ocurrió durante el entrenamiento pero no se guardó como el punto de control final.
- Identifica casos donde la precisión del entrenamiento excede significativamente la precisión de evaluación, lo que indica memorización.
- Marca las ejecuciones con alta oscilación para advertir contra tratar una sola muestra ruidosa como una medición confiable.
- Funciona con HuggingFace Trainer a través de TrustCheckCallback o cualquier bucle personalizado a través de TrustMonitor.
La herramienta ayuda a los usuarios a evitar sacar conclusiones incorrectas de los números finales del registro al resaltar cuándo se perdió el rendimiento máximo del modelo o cuando los datos son demasiado inestables para ser significativos.