В статье обсуждается эффект убывающей отдачи от увеличения объема данных для пост-обучения по мере улучшения моделей, предлагая переход к датасетам более высокого качества. В ней выделяется Parsewave, который генерирует данные для пост-обучения на основе реальных инженерных задач вместе с трассами оценки.

  • Синтетические данные могут стать избыточными, как только модель выучит паттерн, что делает дополнительные вариации менее полезными.
  • Автор выступает за небольшие объемы сложных, реалистичных задач с четким ground truth и надлежащим ревью.
  • Калибровка сложности задач критически важна для предотвращения шума или отсутствия пользы.
  • Parsewave формирует свой датасет из реальных инженерных проблем, а не полагается исключительно на масштабируемость.

Обсуждение ставит под вопрос, что делает образец достойным включения в датасеты SFT/RL/post-training и важнее ли таргетинг на конкретные режимы сбоев, чем масштабируемость.