고립 테스트는 통과하지만 문맥적 복사에 실패하는 'FragileTokens'를 식별한 연구
연구는 "FragileTokens"를 특성화했는데, 이는 개방형 가중치 언어 모델의 어휘 항목으로, 고립되었을 때는 성공적으로 복사되지만 주변 텍스트에 삽입되면 오류를 보입니다. 이 연구는 표준 고립 테스트가 문자 그대로의 정체성 보존을 보장하지 않는다고 강조합니다. 시퀀스 내에서 토큰이 삭제, 대체 또는 잘릴 수 있기 때문입니다.
연구는 "FragileTokens"를 특성화했는데, 이는 개방형 가중치 언어 모델의 어휘 항목으로, 고립되었을 때는 성공적으로 복사되지만 주변 텍스트에 삽입되면 오류를 보입니다. 이 연구는 표준 고립 테스트가 문자 그대로의 정체성 보존을 보장하지 않는다고 강조합니다. 시퀀스 내에서 토큰이 삭제, 대체 또는 잘릴 수 있기 때문입니다.
연구자들은 다차원 항목 반응 이론(Item Response Theory)을 사용하여 개별 프롬프트 수준에서 대규모 언어 모델 벤치마크를 감사하는 방법인 BenchMIRT를 소개했습니다. 100개 모델과 34,000개의 질문에 대한 성능을 분석함으로써 이 도구는 벤치마크 점수를 흐리게 하는 안전과 일반 추론과 같은 혼합 능력을 분리합니다.