"야생" AI 생성 웹 텍스트에 대한 Pangram Labs의 연구는 이러한 토큰을 사전학습 데이터에 추가할 경우 초기에는 인간 텍스트의 손실을 낮추지만 비율이 증가함에 따라 빠르게 해악으로 전환됨을 보여줍니다. 연구자들은 Chinchilla와 같은 기존 법칙들이 예측하지 못하는 이 동학을 반영하는 새로운 스케일링 법칙을 도출하기 위해 800개의 언어 모델을 사전학습했습니다.
- FineWeb 데이터 분석에 따르면 AI 생성 토큰은 2026년 6월의 27.5%에서 8월까지 31.1%로 증가했습니다.
- 데이터가 부족한 모델의 경우, 추가된 AI 토큰은 초기에는 인간 텍스트 손실을 낮추지만 포화 상태에 도달한 후 이를 증가시킵니다.
- 대량의 인간 텍스트로 학습된 모델은 AI 토큰을 추가할 때 거의 즉시 손실이 상승합니다.
- 새로운 스케일링 법칙은 기존 법칙보다 41% 낮은 오차로 최대 3.6배 더 큰 모델에 대한 홀드아웃 인간 텍스트 손실을 예측합니다.
저자들은 목표가 인간 텍스트일 경우 AI 텍스트를 필터링하고, AI 생성 콘텐츠로 데이터셋을 확장하기 전에 인간 텍스트를 반복하며, 인간 텍스트와 AI 텍스트에 대한 검증 손실을 별도로 보고할 것을 권장합니다.