SplatRAG 3+ démontre qu'une mémoire locale par splatting gaussien peut maintenir une haute précision de récupération sur le benchmark SciFact tout en stockant simultanément 5 000 lignes d'argot d'Urban Dictionary sans dégradation.

  • Le système utilise un journal froid en append-only avec BM25 et un index HNSW 64-d, où le champ 3-d sert de visualisation PCA des vecteurs plutôt que l'index lui-même.
  • L'évaluation sur SciFact de 300 affirmations a donné un R@10 de 0,8804 et un nDCG@10 de 0,7624, dépassant les métriques planchers précédentes de 0,88 et 0,75.
  • Les améliorations de performance ont été pilotées par la Fusion de Rang Réciproque (RRF) combinant BM25 avec la sortie cosinus complète 4096-d de Qwen3-Embedding-8B, en exploitant les dimensions précédemment inutilisées.
  • Les filtres d'évaluation garantissent que les résultats domain-scifact ne sont pas contaminés par les entrées d'argot, confirmant que les documents scientifiques restent distincts au sein du champ partagé.

Les résultats indiquent que la récupération lexicale reste primaire pour SciFact et que les stratégies de reranking hybrides peuvent efficacement exploiter l'espace d'embedding haute dimension sans nécessiter de stockage séparé pour des types de données divers.