연구는 "FragileTokens"를 특성화했는데, 이는 개방형 가중치 언어 모델의 어휘 항목으로, 고립되었을 때는 성공적으로 복사되지만 주변 텍스트에 삽입되면 오류를 보입니다. 이 연구는 표준 고립 테스트가 문자 그대로의 정체성 보존을 보장하지 않는다고 강조합니다. 시퀀스 내에서 토큰이 삭제, 대체 또는 잘릴 수 있기 때문입니다.

  • Qwen 및 OLMo 계열의 여덟 개 개방형 가중치 모델을 테스트했으며, 고정된 토큰 ID를 다양한 길이의 무작위 일반 단어 시퀀스에 삽입했습니다.
  • 확률 기반 스크리닝을 통해 고립 테스트를 통과한 토큰 중 0.4%에서 10.9%가 최소 10%의 테스트된 문맥에서 취약한 것으로 나타났습니다.
  • 삭제, 대체, 잘림, 번역 등 특정 실패 모드를 입증했으며, 일부 오류는 집중된 출력 분포 하에서도 발생했습니다.
  • 기하학적 신호를 평가한 결과, 입력 및 출력 임베딩 간 근접성이 일곱 모델에서 이러한 토큰을 식별하는 데 AUROC 0.744에서 0.881의 성능을 보였습니다.
  • 선택된 취약 후보자가 지시 및 시뮬레이션된 도구 사용 작업에서 안정적인 제어군보다 덜 보존됨을 보였습니다.

이 결과는 문맥적 검증 프로토콜의 사용을 촉진하며, 고립 테스트를 통과하는 것이 문자 그대로의 신뢰성에 대한 일반적 인증으로 간주되어서는 안 된다고 주장합니다.