저자는 소비자용 NVIDIA GPU에서 열 인식을 갖춘 QLoRA 파인튜닝을 위한 Windows 우선 런타임인 MOLT를 구축하고, RTX 4060 노트북 GPU에서 100만 개의 Qwen 1.5B 학습 타겟을 사용하여 Unsloth와 벤치마킹했습니다.

  • MOLT의 전체 세션 시간은 1,103초였으며, Unsloth는 1,433초로 총 학습 시간이 23% 감소했습니다.
  • MOLT의 학습 처리량은 초당 1,063개 타겟에 도달한 반면, Unsloth는 초당 768개 타겟으로, 이는 38% 증가를 의미합니다.
  • MOLT의 최대 할당 VRAM은 1.63 GB였으며, Unsloth는 1.85 GB로 메모리 사용량이 12% 감소했습니다.
  • 측정된 보드 에너지 소비량은 MOLT가 63.1 kJ, Unsloth가 63.8 kJ로 거의 동일했습니다.

저자는 이것이 단일 머신, 단일 시드 개발 증거임을 명시하며 Windows NVIDIA GPU 사용자에게 벤치마크를 재현하고 자체 워크로드를 테스트할 것을 요청합니다.