Uma discussão no Reddit destaca que os termos de opção de saída da OpenAI para usuários pagos podem não proteger os tokens de raciocínio internos, permitindo potencialmente que a empresa utilize esses dados para o treinamento do modelo. O argumento gira em torno da ambiguidade sobre se esses tokens ocultos constituem "Saída" conforme o contrato de serviço, dado que os usuários não os recebem diretamente.

  • As políticas de opção de saída de usuários pagos geralmente protegem a "Saída", mas os tokens de raciocínio não são visíveis ao consumidor.
  • Os tokens de raciocínio contêm versões processadas da entrada do usuário e das respostas, tornando-os valiosos para a geração de dados sintéticos.
  • Diferente dos termos atuais da OpenAI, o acordo da Anthropic não exige que o usuário receba a saída para que as proteções de opção de saída se apliquem.
  • Essa brecha poderia permitir que a OpenAI incorporasse dados de raciocínio nas misturas de pré-treinamento ou midtreinamento sem violar as restrições de otimização RL.

Essa distinção é significativa porque sugere que optar por não participar do treinamento pode ser ineficaz se os estados internos do modelo ainda forem utilizados para melhorar versões futuras.