한 연구자가 Small Language Models의 긴 컨텍스트 메모리를 평가하도록 설계된 경량 벤치마크인 Simple Retrieval-Reconstruction Memory (SRRM)을 소개하는 논문에 대한 arXiv cs.CL 승인을 찾고 있습니다.
기존 검색 중심 벤치마크와 달리 SRRM은 대상 검색, 글로벌 정보 재구성과 Memory Preservation Ratio (MPR)라는 새로운 지표를 함께 평가합니다. 저자들은 10–100개의 사실 문장의 컨텍스트 부하 하에서 Qwen2.5 모델 패밀리(0.5B, 1.5B 및 3B)를 테스트했습니다.
결과에 따르면 Qwen2.5-1.5B 모델은 검색 정확도, 재구성 성능 및 MPR에서 더 큰 3B 모델을 일관되게 능가했으며, 이는 매개변수 수만으로는 긴 컨텍스트 메모리 보존이 반드시 향상되지 않음을 시사합니다.