Diskusi di Reddit menyoroti bahwa ketentuan opsi keluar OpenAI bagi pengguna berbayar mungkin tidak melindungi token penalaran internal, yang berpotensi memungkinkan perusahaan menggunakan data ini untuk pelatihan model. Argumen utamanya terletak pada ambiguitas apakah token tersembunyi ini merupakan "Output" sesuai perjanjian layanan, mengingat pengguna tidak menerimanya secara langsung.

  • Kebijakan opsi keluar pengguna berbayar biasanya melindungi "Output," tetapi token penalaran tidak terlihat oleh konsumen.
  • Token penalaran berisi versi yang diproses dari input dan respons pengguna, sehingga bernilai tinggi untuk pembuatan data sintetis.
  • Berbeda dengan ketentuan OpenAI saat ini, perjanjian Anthropic tidak mengharuskan pengguna menerima output agar perlindungan opsi keluar berlaku.
  • Lubang hukum ini dapat memungkinkan OpenAI memasukkan data penalaran ke dalam campuran pra-pelatihan atau pertengahan pelatihan tanpa melanggar pembatasan optimisasi RL.

Pembedaan ini signifikan karena menunjukkan bahwa memilih keluar dari pelatihan mungkin tidak efektif jika keadaan model internal masih digunakan untuk meningkatkan versi masa depan.