O artigo discute o retorno decrescente ao aumentar o volume de dados de pós-treinamento à medida que os modelos melhoram, sugerindo uma mudança para conjuntos de dados de maior qualidade. Destaca o Parsewave, que gera dados de pós-treinamento a partir de problemas de engenharia do mundo real junto com rastros de avaliação.
- Dados sintéticos podem se tornar redundantes assim que um modelo aprende um padrão, tornando variações adicionais menos úteis.
- O autor defende pequenas quantidades de tarefas desafiadoras e realistas com ground truth claro e revisão adequada.
- Calibrar a dificuldade da tarefa é crítico para evitar ruído ou falta de benefício.
- O Parsewave constrói seu conjunto de dados a partir de problemas de engenharia do mundo real em vez de depender apenas da escalabilidade.
A discussão questiona o que torna uma amostra digna de inclusão nos conjuntos de dados SFT/RL/pós-treinamento e se direcionar modos de falha específicos é mais importante do que a escalabilidade.