O Papers with Code implementou um sistema de busca híbrida que combina recuperação por palavras-chave e semântica para ajudar os usuários a encontrar artigos relevantes de pesquisa em IA. A arquitetura utiliza o Hugging Face Jobs, Storage Buckets e Inference Endpoints para gerenciar o pipeline de embeddings e atender consultas com baixa latência.
- O Hugging Face Jobs fornece computação GPU escalonável para gerar embeddings de mais de 110.000 artigos usando o modelo Qwen/Qwen3-Embedding-0.6B.
- Os Storage Buckets atuam como armazenamento durável entre exportações do banco de dados, processamento de jobs e importação de índices.
- Os Inference Endpoints fornecem embeddings com baixa latência para consultas em tempo real, caindo para recuperação por texto completo se não estiverem disponíveis.
- O sistema utiliza fusão de classificação recíproca (RRF) para combinar a busca lexical do PostgreSQL com a busca vetorial densa do pgvector.
- Um contrato rigoroso de embeddings garante reprodutibilidade ao versionar a revisão do modelo, o formato de entrada e o método de normalização.
Essa separação entre a construção offline do corpus e os serviços de busca online permite que a plataforma mantenha tanto alta qualidade de recuperação quanto tempos de resposta rápidos para pesquisadores.