使用 AGIO 框架对 Dolphin 3.0 Llama 3.1 8B 模型进行的实验性微调运行表明,尽管训练损失继续急剧下降,但 GPQA Diamond 分数在初始上升后停止改善。
- 起始模型的 GPQA Diamond 得分为 49/198(24.75%),在 CP24 和 CP36 检查点达到峰值 60/198,随后在运行剩余期间在 54 到 56 之间波动。
- 训练使用了学习率调度策略,起始值为 1.50e-05,经过四个 epoch 后降至 1.15e-05,此后保持恒定。
- 尽管外部准确率趋于平稳,但内部指标如 GAP 从 0.7615 增加到 1.2999,表明模型可能更坚定地坚持其选择,而非获得通用能力。
- 作者指出,尽管损失减少与基准性能之间存在差异,但推理能力得以保持,未退化为“鹦鹉学舌”行为。
该实验强调了在微调过程中监控学习率轨迹的重要性,因为继续训练并不一定带来外部评估指标的成比例提升。