Sebuah eksperimen fine-tuning model Dolphin 3.0 Llama 3.1 8B menggunakan framework AGIO mengungkapkan bahwa skor GPQA Diamond berhenti meningkat setelah kenaikan awal, meskipun training loss terus menurun tajam.
- Model awal mencapai skor GPQA Diamond sebesar 49/198 (24,75%), yang memuncak di 60/198 pada checkpoint CP24 dan CP36 sebelum berfluktuasi antara 54 dan 56 untuk sisa eksperimen.
- Training menggunakan jadwal learning rate yang dimulai dari 1.50e-05, menurun menjadi 1.15e-05 setelah empat epoch, dan tetap konstan selanjutnya.
- Sementara akurasi eksternal mendatar, metrik internal seperti GAP meningkat dari 0.7615 menjadi 1.2999, menunjukkan bahwa model mungkin lebih berkomitmen pada pilihannya daripada memperoleh kemampuan umum.
- Penulis mencatat bahwa kemampuan penalaran dipertahankan tanpa degradasi menjadi perilaku "parrot", meskipun terdapat divergensi antara pengurangan loss dan kinerja benchmark.
Eksperimen ini menyoroti pentingnya memantau trajektori learning rate selama fine-tuning, karena pelatihan lebih lanjut tidak selalu menghasilkan peningkatan proporsional pada metrik evaluasi eksternal.