В статье обсуждается эффект убывающей отдачи от увеличения объема данных для пост-обучения по мере улучшения моделей, предлагая переход к датасетам более высокого качества. В ней выделяется Parsewave, который генерирует данные для пост-обучения на основе реальных инженерных задач вместе с трассами оценки.
- Синтетические данные могут стать избыточными, как только модель выучит паттерн, что делает дополнительные вариации менее полезными.
- Автор выступает за небольшие объемы сложных, реалистичных задач с четким ground truth и надлежащим ревью.
- Калибровка сложности задач критически важна для предотвращения шума или отсутствия пользы.
- Parsewave формирует свой датасет из реальных инженерных проблем, а не полагается исключительно на масштабируемость.
Обсуждение ставит под вопрос, что делает образец достойным включения в датасеты SFT/RL/post-training и важнее ли таргетинг на конкретные режимы сбоев, чем масштабируемость.