लेखक ने उपभोक्ता NVIDIA GPU पर थर्मली अवेयर QLoRA फाइन-ट्यूनिंग के लिए Windows-फर्स्ट रनटाइम MOLT बनाया है, और RTX 4060 Laptop GPU पर एक मिलियन Qwen 1.5B ट्रेनिंग टारगेट का उपयोग करके इसका Unsloth के साथ बेंचमार्क किया है।

  • MOLT के लिए एंड-टू-एंड सेशन समय 1,103 सेकंड था जबकि Unsloth के लिए 1,433 सेकंड था, जिससे कुल ट्रेनिंग समय में 23% की कमी आई।
  • MOLT के साथ ट्रेनिंग थ्रूपुट 1,063 टारगेट्स/सेकंड तक पहुंचा, जबकि Unsloth के साथ 768 टारगेट्स/सेकंड था, जो 38% की वृद्धि दर्शाता है।
  • MOLT के लिए पीक आवंटित VRAM 1.63 GB था जबकि Unsloth के लिए 1.85 GB था, जिससे मेमोरी उपयोग में 12% की कमी आई।
  • मापा गया बोर्ड ऊर्जा खपत लगभग समान था: MOLT के लिए 63.1 kJ और Unsloth के लिए 63.8 kJ।

लेखक ने नोट किया है कि यह सिंगल-मशीन, सिंगल-सीड डेवलपमेंट प्रमाण है और Windows NVIDIA GPU उपयोगकर्ताओं को बेंचमार्क की पुनरावृत्ति करने और अपने स्वयं के वर्कलोड का परीक्षण करने के लिए आमंत्रित किया है।