Uma execução experimental de ajuste fino do modelo Dolphin 3.0 Llama 3.1 8B usando o framework AGIO revela que as pontuações GPQA Diamond param de melhorar após um aumento inicial, mesmo que a perda de treinamento continue caindo acentuadamente.
- O modelo inicial alcançou uma pontuação GPQA Diamond de 49/198 (24,75%), que atingiu o pico de 60/198 nos checkpoints CP24 e CP36 antes de oscilar entre 54 e 56 pelo restante da execução.
- O treinamento utilizou um agendamento de taxa de aprendizado que começou em 1.50e-05, diminuiu para 1.15e-05 após quatro épocas e permaneceu constante a partir daí.
- Enquanto a precisão externa estagnou, métricas internas como o GAP aumentaram de 0.7615 para 1.2999, sugerindo que o modelo pode estar se comprometendo mais fortemente com suas escolhas em vez de ganhar capacidade geral.
- O autor observa que as capacidades de raciocínio foram mantidas sem degradação para comportamento de "papagaio", apesar da divergência entre a redução da perda e o desempenho no benchmark.
O experimento destaca a importância de monitorar as trajetórias da taxa de aprendizado durante o ajuste fino, pois o treinamento contínuo não necessariamente produz melhorias proporcionais nas métricas de avaliação externa.