Una discusión en Reddit destaca que los términos de exclusión voluntaria de OpenAI para usuarios pagados podrían no proteger los tokens de razonamiento internos, permitiendo potencialmente a la empresa utilizar estos datos para el entrenamiento del modelo. El argumento se centra en la ambigüedad sobre si estos tokens ocultos constituyen "Salida" según el acuerdo de servicio, dado que los usuarios no los reciben directamente.
- Las políticas de exclusión voluntaria de usuarios pagados suelen proteger la "Salida", pero los tokens de razonamiento no son visibles para el consumidor.
- Los tokens de razonamiento contienen versiones procesadas de la entrada y las respuestas del usuario, lo que los hace valiosos para la generación de datos sintéticos.
- A diferencia de los términos actuales de OpenAI, el acuerdo de Anthropic no requiere que el usuario reciba la salida para que se apliquen las protecciones de exclusión voluntaria.
- Esta laguna podría permitir a OpenAI incorporar datos de razonamiento en mezclas de preentrenamiento o entrenamiento intermedio sin violar las restricciones de optimización RL.
Esta distinción es significativa porque sugiere que optar por no participar en el entrenamiento podría ser ineficaz si los estados internos del modelo siguen utilizándose para mejorar las versiones futuras.