FitCheck est un nouvel outil qui estime les exigences maximales de VRAM pour le LoRA, le QLoRA et le réglage fin complet des grands modèles de langage sans nécessiter PyTorch, CUDA ou du matériel GPU réel.

  • Il analyse la config.json du modèle sur Hugging Face et les métadonnées du nombre de paramètres pour fournir un détail de la mémoire, la capacité utilisable, la marge et les verdicts d'ajustement.
  • L'outil prend en charge les estimations de service basées sur les poids du modèle et le cache KV, ainsi qu'un conseiller pour explorer la taille du lot, la longueur de séquence et le rang LoRA.
  • Les tests sur une Tesla T4 ont montré une erreur absolue moyenne de 2,4 % sur 57 exécutions de calibration et ont produit 12/12 verdicts corrects de limite d'ajustement dans un test de rétention séparé.

L'outil aide les utilisateurs à déterminer si leur configuration LLM tiendra dans la mémoire GPU avant de démarrer une tâche, visant à réduire les suppositions et les erreurs de manque de mémoire.