作者构建了MOLT,这是一个面向Windows的运行时环境,用于在消费级NVIDIA GPU上进行热感知QLoRA微调,并使用一个RTX 4060笔记本GPU上的100万个Qwen 1.5B训练目标将其与Unsloth进行了基准测试。

  • MOLT的端到端会话时间为1,103秒,而Unsloth为1,433秒,总训练时间减少了23%。
  • MOLT的训练吞吐量达到1,063个目标/秒,而Unsloth为768个目标/秒,提升了38%。
  • MOLT的峰值分配显存为1.63 GB,而Unsloth为1.85 GB,内存使用量减少了12%。
  • 测得的板卡能耗几乎相同,MOLT为63.1 kJ,Unsloth为63.8 kJ。

作者指出这是单台机器、单次种子开发的证据,并邀请Windows NVIDIA GPU用户复现该基准测试并测试他们自己的工作负载。