L'auteur a développé MOLT, un runtime prioritairement pour Windows dédié à l'affinage QLoRA conscient de la thermique sur des GPU NVIDIA grand public, et l'a comparé à Unsloth en utilisant un million de cibles d'entraînement Qwen 1.5B sur un GPU RTX 4060 Laptop.
- Le temps total de session était de 1 103 secondes pour MOLT contre 1 433 secondes pour Unsloth, soit une réduction de 23 % du temps total d'entraînement.
- Le débit d'entraînement a atteint 1 063 cibles/s avec MOLT comparé à 768 cibles/s avec Unsloth, représentant une augmentation de 38 %.
- La VRAM allouée maximale était de 1,63 Go pour MOLT contre 1,85 Go pour Unsloth, soit une diminution de 12 % de l'utilisation de la mémoire.
- La consommation énergétique mesurée de la carte était quasi identique à 63,1 kJ pour MOLT et 63,8 kJ pour Unsloth.
L'auteur note qu'il s'agit d'une preuve de développement sur une seule machine avec un seul seed et invite les utilisateurs de GPU NVIDIA sous Windows à reproduire le benchmark et à tester leurs propres charges de travail.