Redditでの議論は、OpenAIの有料ユーザー向けのオプトアウト条項が内部推論トークンを守らない可能性があり、同社がこのデータをモデルトレーニングに使用することを可能にするかもしれないと指摘している。この議論の中心は、ユーザーがこれらの隠しトークンを直接受信しないことを考慮すると、これらの隠しトークンがサービス契約において「出力」を構成するかどうかの曖昧さにある。

  • 有料ユーザーのオプトアウトポリシーは通常「出力」を守るが、推論トークンは消費者には見えない。
  • 推論トークンにはユーザーの入力と応答のプロセス済みのバージョンが含まれており、合成データ生成にとって価値がある。
  • OpenAIの現在の条項とは異なり、Anthropicの契約では、オプトアウト保護が適用されるためにユーザーが出力を受信する必要はない。
  • この抜け穴により、OpenAIはRL最適化の制限に違反せずに、事前トレーニングや中間トレーニングのミックスに推論データを取り込むことができる可能性がある。

この区別は重要である。なぜなら、内部モデル状態が将来のバージョンの改善にまだ利用されている場合、トレーニングからのオプトアウトが無効になる可能性を示唆しているからである。