Un investigador busca un aval de arXiv cs.CL para un artículo que presenta Simple Retrieval-Reconstruction Memory (SRRM), un benchmark ligero diseñado para evaluar la memoria de contexto largo en Modelos de Lenguaje Pequeños.
A diferencia de los benchmarks existentes orientados a la recuperación, SRRM evalúa conjuntamente la recuperación dirigida, la reconstrucción global de información y una nueva métrica llamada Memory Preservation Ratio (MPR). Los autores probaron la familia de modelos Qwen2.5 (0.5B, 1.5B y 3B) bajo cargas de contexto de 10–100 declaraciones factuales.
Los resultados mostraron que el modelo Qwen2.5-1.5B superó consistentemente al modelo más grande 3B en precisión de recuperación, rendimiento de reconstrucción y MPR, lo que sugiere que la cantidad de parámetros por sí sola no necesariamente mejora la preservación de la memoria de contexto largo.