Una ejecución experimental de ajuste fino del modelo Dolphin 3.0 Llama 3.1 8B utilizando el framework AGIO revela que las puntuaciones de GPQA Diamond dejan de mejorar después de un aumento inicial, incluso mientras la pérdida de entrenamiento continúa disminuyendo drásticamente.

  • El modelo inicial logró una puntuación de GPQA Diamond de 49/198 (24.75%), que alcanzó su punto máximo en 60/198 en los checkpoints CP24 y CP36 antes de fluctuar entre 54 y 56 durante el resto de la ejecución.
  • El entrenamiento utilizó un programa de tasa de aprendizaje que comenzó en 1.50e-05, disminuyó a 1.15e-05 después de cuatro épocas y se mantuvo constante desde entonces.
  • Mientras la precisión externa se estancaba, las métricas internas como GAP aumentaron de 0.7615 a 1.2999, lo que sugiere que el modelo puede estar comprometiéndose más firmemente con sus elecciones en lugar de ganar capacidad general.
  • El autor señala que las capacidades de razonamiento se mantuvieron sin degradarse hacia un comportamiento de "loro", a pesar de la divergencia entre la reducción de pérdida y el rendimiento en benchmarks.

El experimento resalta la importancia de monitorear las trayectorias de la tasa de aprendizaje durante el ajuste fino, ya que el entrenamiento continuo no necesariamente produce mejoras proporcionales en las métricas de evaluación externa.