Исследователь ищет одобрение arXiv cs.CL для статьи, представляющей Simple Retrieval-Reconstruction Memory (SRRM), легкий бенчмарк, предназначенный для оценки долговременной контекстной памяти в малых языковых моделях.

В отличие от существующих бенчмарков, ориентированных на извлечение информации, SRRM совместно оценивает целевое извлечение, глобальную реконструкцию информации и новую метрику под названием Memory Preservation Ratio (MPR). Авторы протестировали семейство моделей Qwen2.5 (0.5B, 1.5B и 3B) при нагрузках контекста в виде 10–100 фактических утверждений.

Результаты показали, что модель Qwen2.5-1.5B последовательно превосходит более крупную модель 3B по точности извлечения, производительности реконструкции и MPR, что предполагает: количество параметров само по себе не обязательно улучшает сохранение долговременной контекстной памяти.