El artículo discute el rendimiento decreciente al aumentar el volumen de datos de post-entrenamiento a medida que mejoran los modelos, sugiriendo un cambio hacia conjuntos de datos de mayor calidad. Destaca Parsewave, que genera datos de post-entrenamiento a partir de problemas de ingeniería del mundo real junto con trazas de evaluación.
- Los datos sintéticos pueden volverse redundantes una vez que un modelo aprende un patrón, haciendo que las variaciones adicionales sean menos útiles.
- El autor aboga por pequeñas cantidades de tareas desafiantes y realistas con ground truth claro y revisión adecuada.
- Calibrar la dificultad de la tarea es crítico para evitar ruido o falta de beneficio.
- Parsewave construye su conjunto de datos a partir de problemas de ingeniería del mundo real en lugar de depender únicamente de la escalabilidad.
La discusión cuestiona qué hace que una muestra sea digna de incluirse en los conjuntos de datos SFT/RL/post-training y si enfocarse en modos de fallo específicos es más importante que la escalabilidad.