Une exécution expérimentale de fine-tuning du modèle Dolphin 3.0 Llama 3.1 8B à l'aide du framework AGIO révèle que les scores GPQA Diamond cessent de s'améliorer après une hausse initiale, même si la perte d'entraînement continue de chuter fortement.
- Le modèle initial a obtenu un score GPQA Diamond de 49/198 (24,75 %), qui a atteint un pic de 60/198 dans les checkpoints CP24 et CP36 avant de fluctuer entre 54 et 56 pour le reste de l'exécution.
- L'entraînement a utilisé une planification du taux d'apprentissage qui a commencé à 1,50e-05, a diminué à 1,15e-05 après quatre époques, et est resté constant par la suite.
- Alors que la précision externe stagnait, les métriques internes comme le GAP ont augmenté de 0,7615 à 1,2999, suggérant que le modèle s'engage davantage dans ses choix plutôt qu'il ne gagne en capacité générale.
- L'auteur note que les capacités de raisonnement ont été maintenues sans dégradation vers un comportement de « perroquet », malgré la divergence entre la réduction de la perte et les performances aux benchmarks.
L'expérience met en évidence l'importance de surveiller les trajectoires du taux d'apprentissage pendant le fine-tuning, car un entraînement continu ne garantit pas nécessairement des améliorations proportionnelles dans les métriques d'évaluation externes.