लेखक ने metrictrust विकसित किया, एक हल्का पायथन टूल जो प्रशिक्षण रनों की निगरानी करता है ताकि यह निर्धारित किया जा सके कि अंतिम सत्यापन मापदंडों पर भरोसा किया जाना चाहिए या नहीं। यह सामान्य समस्याओं जैसे उप-अनुकूल चेकपॉइंट्स को बनाए रखने, मेमोराइजेशन के कारण प्रदर्शन का अत्यधिक आकलन करने, और शोर वाले दोलनकारी परिणामों पर निर्भर रहने से निपटता है।
- प्रशिक्षण गतिशीलता के आधार पर 'विश्वास', 'सावधानी' या 'अविश्वास' की सरल भाषा में राय प्रदान करता है।
- पता लगाता है कि सबसे अच्छा मापदंड प्रशिक्षण के बीच में हुआ था लेकिन अंतिम चेकपॉइंट के रूप में सहेजा नहीं गया था।
- उन मामलों की पहचान करता है जहां प्रशिक्षण सटीकता मूल्यांकन सटीकता से काफी अधिक होती है, जो मेमोराइजेशन को इंगित करता है।
- उच्च दोलन वाले रनों को फ्लैग करता है ताकि एक अकेले शोर वाले नमूने को विश्वसनीय माप मानने से रोका जा सके।
- TrustCheckCallback के माध्यम से HuggingFace Trainer या TrustMonitor के माध्यम से किसी भी कस्टम लूप के साथ काम करता है।
यह टूल उपयोगकर्ताओं को अंतिम लॉग संख्याओं से गलत निष्कर्ष निकालने से बचाने में मदद करता है, यह उजागर करके कि मॉडल का शीर्ष प्रदर्शन कब छूट गया या डेटा इतना अस्थिर है कि वह सार्थक नहीं है।