Un chercheur sollicite un avis favorable d'arXiv cs.CL pour un article présentant la Simple Retrieval-Reconstruction Memory (SRRM), un benchmark léger conçu pour évaluer la mémoire de contexte long dans les Small Language Models.
Contrairement aux benchmarks existants orientés vers la récupération, SRRM évalue conjointement la récupération ciblée, la reconstruction globale de l'information et une nouvelle métrique appelée Memory Preservation Ratio (MPR). Les auteurs ont testé la famille de modèles Qwen2.5 (0.5B, 1.5B et 3B) sous des charges de contexte de 10 à 100 énoncés factuels.
Les résultats ont montré que le modèle Qwen2.5-1.5B a systématiquement surpassé le modèle plus volumineux 3B en précision de récupération, performance de reconstruction et MPR, suggérant que le nombre de paramètres seul n'améliore pas nécessairement la préservation de la mémoire de contexte long.