Penulis mengembangkan metrictrust, alat Python ringan yang memantau proses pelatihan untuk menentukan apakah metrik validasi akhir dapat dipercaya. Alat ini mengatasi masalah umum seperti menyimpan checkpoint suboptimal, melebih-lebihkan kinerja karena hafalan, dan mengandalkan hasil berfluktuasi yang bising.

  • Memberikan putusan dalam bahasa sederhana berupa 'dipercaya', 'waspada', atau 'tidak-dipercaya' berdasarkan dinamika pelatihan.
  • Mendeteksi ketika metrik terbaik terjadi di tengah pelatihan tetapi tidak disimpan sebagai checkpoint akhir.
  • Mengidentifikasi kasus di mana akurasi pelatihan jauh melebihi akurasi evaluasi, yang menunjukkan adanya hafalan.
  • Menandai proses dengan fluktuasi tinggi untuk memperingatkan agar tidak menganggap satu sampel bising sebagai pengukuran yang andal.
  • Bekerja dengan HuggingFace Trainer melalui TrustCheckCallback atau loop kustom apa pun melalui TrustMonitor.

Alat ini membantu pengguna menghindari kesimpulan salah dari angka log akhir dengan menyoroti ketika kinerja puncak model terlewatkan atau ketika data terlalu tidak stabil untuk bermakna.