著者は、消費者向けNVIDIA GPU上で熱を考慮したQLoRAファインチューニングを行うためのWindows優先ランタイムであるMOLTを開発し、RTX 4060 Laptop GPUで100万個のQwen 1.5Bトレーニングターゲットを用いてUnslothとのベンチマークを実施しました。

  • MOLTのエンドツーエンドセッション時間は1,103秒、Unslothは1,433秒で、総トレーニング時間が23%短縮されました。
  • トレーニングスループットはMOLTで1,063 targets/s、Unslothで768 targets/sとなり、38%の増加となりました。
  • ピーク割り当てVRAMはMOLTで1.63 GB、Unslothで1.85 GBで、メモリ使用量が12%減少しました。
  • 測定されたボードエネルギー消費量は、MOLTが63.1 kJ、Unslothが63.8 kJでほぼ同等でした。

著者はこれは単一マシン・単一シードの開発証拠であると指摘し、Windows NVIDIA GPUユーザーにベンチマークの再現と独自のワークロードのテストを呼びかけています。