Экспериментальное дообучение модели Dolphin 3.0 Llama 3.1 8B с использованием фреймворка AGIO выявило, что оценки GPQA Diamond перестают улучшаться после начального роста, даже когда обучающие потери продолжают резко снижаться.

  • Исходная модель достигла оценки GPQA Diamond 49/198 (24,75%), которая достигла пика в 60/198 на контрольных точках CP24 и CP36, а затем колебалась между 54 и 56 до конца эксперимента.
  • Обучение использовало график скорости обучения, который начинался с 1.50e-05, снижался до 1.15e-05 после четырех эпох и оставался постоянным thereafter.
  • Пока внешняя точность вышла на плато, внутренние метрики, такие как GAP, увеличились с 0.7615 до 1.2999, что предполагает, что модель может сильнее привязываться к своим выборам, а не приобретать общие способности.
  • Автор отмечает, что способности к рассуждению сохранялись без деградации в поведение «попугая», несмотря на расхождение между снижением потерь и производительностью в бенчмарках.

Эксперимент подчеркивает важность мониторинга траекторий скорости обучения во время дообучения, поскольку продолжение тренировки не обязательно приводит к пропорциональному улучшению внешних метрик оценки.