Автор разработал metrictrust — лёгкий инструмент на Python, который отслеживает процессы обучения, чтобы определить, можно ли доверять финальным метрикам валидации. Он решает распространённые проблемы, такие как сохранение субоптимальных чекпоинтов, завышение производительности из-за запоминания и опора на зашумлённые колеблющиеся результаты.
- Выносит вердикт «доверять», «осторожно» или «не доверять» простым языком на основе динамики обучения.
- Определяет случаи, когда наилучшая метрика была достигнута в середине обучения, но не сохранена как финальный чекпоинт.
- Выявляет ситуации, когда точность на обучающей выборке значительно превышает точность на проверочной, что указывает на запоминание.
- Помечает запуски с высокой осцилляцией, предупреждая против трактовки единичного зашумлённого значения как надёжного измерения.
- Работает с HuggingFace Trainer через TrustCheckCallback или с любым пользовательским циклом через TrustMonitor.
Инструмент помогает пользователям избегать неверных выводов по финальным числам в логах, подсвечивая моменты, когда пиковая производительность модели была упущена или данные слишком нестабильны для осмысленной интерпретации.