O autor desenvolveu o MOLT, um runtime focado em Windows para ajuste fino de QLoRA consciente da temperatura em GPUs NVIDIA de consumo, e o benchmarkou contra o Unsloth usando um milhão de alvos de treinamento do Qwen 1.5B em uma GPU RTX 4060 Laptop.

  • O tempo total da sessão foi de 1.103 segundos para o MOLT versus 1.433 segundos para o Unsloth, uma redução de 23% no tempo total de treinamento.
  • A taxa de treinamento atingiu 1.063 alvos/s com o MOLT em comparação a 768 alvos/s com o Unsloth, representando um aumento de 38%.
  • O VRAM alocado máximo foi de 1,63 GB para o MOLT versus 1,85 GB para o Unsloth, uma redução de 12% no uso de memória.
  • O consumo de energia da placa medido foi quase idêntico em 63,1 kJ para o MOLT e 63,8 kJ para o Unsloth.

O autor observa que esta é uma evidência de desenvolvimento de máquina única e semente única e convida usuários de GPUs NVIDIA no Windows a reproduzir o benchmark e testar suas próprias cargas de trabalho.