AGIO 프레임워크를 사용하여 Dolphin 3.0 Llama 3.1 8B 모델을 파인튜닝한 실험 결과, 학습 손실이 급격히 하락하는 동안에도 GPQA Diamond 점수는 초기 상승 이후 더 이상 개선되지 않는 것으로 나타났습니다.

  • 시작 모델은 GPQA Diamond 점수 49/198(24.75%)를 기록했으며, 체크포인트 CP24와 CP36에서 60/198로 정점을 찍은 후 나머지 실험 기간 동안 54~56 사이에서 변동했습니다.
  • 학습은 초기 학습률을 1.50e-05로 설정하고, 4에포크 후에 1.15e-05로 감소시킨 뒤 일정하게 유지하는 학습률 스케줄을 사용했습니다.
  • 외부 정확도는 정체되었지만, GAP와 같은 내부 지표는 0.7615에서 1.2999로 증가했으며, 이는 모델이 일반적인 능력을 얻기보다 자신의 선택에 더 강하게 고정되고 있음을 시사합니다.
  • 손실 감소와 벤치마크 성능 간의 괴리가 있음에도 불구하고, 저자는 추론 능력이 "앵무새