Автор разработал metrictrust — лёгкий инструмент на Python, который отслеживает процессы обучения, чтобы определить, можно ли доверять финальным метрикам валидации. Он решает распространённые проблемы, такие как сохранение субоптимальных чекпоинтов, завышение производительности из-за запоминания и опора на зашумлённые колеблющиеся результаты.

  • Выносит вердикт «доверять», «осторожно» или «не доверять» простым языком на основе динамики обучения.
  • Определяет случаи, когда наилучшая метрика была достигнута в середине обучения, но не сохранена как финальный чекпоинт.
  • Выявляет ситуации, когда точность на обучающей выборке значительно превышает точность на проверочной, что указывает на запоминание.
  • Помечает запуски с высокой осцилляцией, предупреждая против трактовки единичного зашумлённого значения как надёжного измерения.
  • Работает с HuggingFace Trainer через TrustCheckCallback или с любым пользовательским циклом через TrustMonitor.

Инструмент помогает пользователям избегать неверных выводов по финальным числам в логах, подсвечивая моменты, когда пиковая производительность модели была упущена или данные слишком нестабильны для осмысленной интерпретации.