ある研究者が、Small Language Modelsの長文脈メモリを評価するために設計された軽量ベンチマークであるSimple Retrieval-Reconstruction Memory (SRRM)を紹介する論文に対するarXiv cs.CLの推薦を求めています。
既存の検索指向のベンチマークとは異なり、SRRMは対象検索、グローバル情報再構築、およびMemory Preservation Ratio (MPR)と呼ばれる新しい指標を共同で評価します。著者たちは、10〜100の事実文のコンテキスト負荷の下でQwen2.5モデルファミリー(0.5B、1.5B、3B)をテストしました。
結果は、Qwen2.5-1.5Bモデルが検索精度、再構築パフォーマンス、およびMPRにおいて一貫してより大きな3Bモデルを上回ったことを示しており、パラメータ数だけでは必ずしも長文脈メモリの保持が向上するわけではないことを示唆しています。