레딧의 토론은 OpenAI의 유료 사용자를 위한 옵트아웃 약관이 내부 추론 토큰을 보호하지 않을 수 있으며, 이로 인해 회사가 이 데이터를 모델 학습에 사용할 가능성이 있음을 강조합니다. 논쟁의 핵심은 사용자가 이를 직접 받지 않기 때문에 이러한 숨겨진 토큰이 서비스 약관 하에서 "출력"으로 간주될지 여부의 모호성에 있습니다.

  • 유료 사용자 옵트아웃 정책은 일반적으로 "출력"을 보호하지만, 추론 토큰은 소비자에게 보이지 않습니다.
  • 추론 토큰에는 사용자 입력과 응답의 처리된 버전이 포함되어 있어 합성 데이터 생성에 가치가 있습니다.
  • OpenAI의 현재 약관과 달리 Anthropic의 약관은 옵트아웃 보호가 적용되기 위해 사용자가 출력을 받아야 한다고 요구하지 않습니다.
  • 이 구멍을 통해 OpenAI는 RL 최적화 제한을 위반하지 않고 사전 학습 또는 중간 학습 혼합물에 추론 데이터를 통합할 수 있습니다.

이 차이는 내부 모델 상태가 향후 버전 개선에 여전히 사용된다면 학습 옵트아웃이 효과적이지 않을 수 있음을 시사하기 때문에 중요합니다.