Pangram Labs의 800개 사전학습 언어 모델에 대한 연구는 최근 웹 데이터의 31% 이상을 차지하는 "야생" AI 생성 웹 텍스트가 인간 텍스트 처리를 목표로 할 때 모델 성능에 부정적인 영향을 미친다는 것을 보여줍니다. 이 연구는 소량의 AI 토큰이 초기에는 데이터가 부족한 모델에 도움이 될 수 있지만, 그 비율이 증가함에 따라 빠르게 해로워진다는 점을 입증합니다.
- 인간의 텍스트에 높은 예산으로 학습된 모델의 경우, AI 토큰을 추가하면 손실이 거의 즉시 증가하는 반면, 새로운 인간 토큰은 지속적으로 손실을 낮춥니다.
- 기존 스케일링 법칙은 이러한 동작을 예측하지 못합니다. 저자들은 기존 방법 대비 예측 오차를 41% 줄이는 별도의 이득과 해악 항을 포함하는 새로운 법칙을 제안합니다.
- 연구는 인간 대상 모델에 대해 AI 텍스트를 필터링하고, AI 데이터를 추가하기 전에 인간 텍스트를 반복하며, 인간 텍스트와 AI 텍스트에 대한 검증 손실을 별도로 보고할 것을 권장합니다.
이 결과는 AI 텍스트가 목표가 AI 텍스트일 때만 여전히 가치 있음을 시사하지만, 인간 중심 작업을 위해 학습할 때는 필터링하거나 신중하게 처리해야 함을 의미합니다. 저자들은 레이블이 포함된 83B 토큰 코퍼스인 WildAI와 코드 및 모델 가중치를 공개했습니다.