Une discussion sur Reddit met en évidence que les conditions de désinscription d'OpenAI pour les utilisateurs payants pourraient ne pas protéger les tokens de raisonnement internes, permettant potentiellement à l'entreprise d'utiliser ces données pour l'entraînement des modèles. L'argument repose sur l'ambiguïté quant au savoir si ces tokens cachés constituent une « Sortie » au sens du contrat de service, étant donné que les utilisateurs ne les reçoivent pas directement.

  • Les politiques de désinscription des utilisateurs payants protègent généralement la « Sortie », mais les tokens de raisonnement ne sont pas visibles pour le consommateur.
  • Les tokens de raisonnement contiennent des versions traitées des entrées et réponses de l'utilisateur, ce qui les rend précieux pour la génération de données synthétiques.
  • Contrairement aux conditions actuelles d'OpenAI, le contrat d'Anthropic n'exige pas que l'utilisateur reçoive la sortie pour que les protections de désinscription s'appliquent.
  • Cette faille pourrait permettre à OpenAI d'intégrer les données de raisonnement dans les mélanges de pré-entraînement ou de mi-entraînement sans violer les restrictions d'optimisation RL.

Cette distinction est significative car elle suggère que la désinscription de l'entraînement pourrait être inefficace si les états internes du modèle sont toujours utilisés pour améliorer les futures versions.