Papers with Code a mis en place un système de recherche hybride combinant le retour par mots-clés et la récupération sémantique afin d'aider les utilisateurs à trouver des articles de recherche pertinents sur l'IA. L'architecture exploite Hugging Face Jobs, Storage Buckets et Inference Endpoints pour gérer le pipeline d'embedding et servir des requêtes à faible latence.
- Hugging Face Jobs fournit une capacité GPU élastique pour l'embedding de plus de 110 000 articles en utilisant le modèle Qwen/Qwen3-Embedding-0.6B.
- Storage Buckets agissent comme un stockage durable entre les exportations de base de données, le traitement des tâches et l'importation d'index.
- Inference Endpoints servent des embeddings à faible latence pour les requêtes en direct, avec un retour au retour par texte intégral si indisponible.
- Le système utilise la fusion de rang réciproque (RRF) pour combiner la recherche lexicale PostgreSQL avec la recherche vectorielle dense depuis pgvector.
- Un contrat d'embedding strict assure la reproductibilité en versionnant la révision du modèle, le format d'entrée et la méthode de normalisation.
Cette séparation entre la construction hors ligne du corpus et les services de recherche en ligne permet à la plateforme de maintenir à la fois une haute qualité de récupération et des temps de réponse rapides pour les chercheurs.