作者开发了 metrictrust,这是一个轻量级 Python 工具,用于监控训练运行过程,以确定最终验证指标是否可信。它解决了常见问题,例如保留次优检查点、因记忆效应而高估性能,以及依赖噪声振荡结果。

  • 基于训练动态提供“可信”、“谨慎”或“不可信”的通俗判断。
  • 检测最佳指标出现在训练中期但未保存为最终检查点的情况。
  • 识别训练准确率显著高于评估准确率的情况,表明存在记忆效应。
  • 标记具有高振荡性的运行过程,警告不要将单个噪声样本视为可靠测量值。
  • 通过 TrustCheckCallback 与 HuggingFace Trainer 配合使用,或通过 TrustMonitor 用于任何自定义循环。

该工具通过突出显示模型峰值性能被错过或数据过于不稳定而无法提供有意义信息的情况,帮助用户避免从最终日志数值中得出错误结论。