O Papers with Code implementou um sistema de busca híbrida que combina recuperação por palavras-chave e semântica para ajudar os usuários a encontrar artigos relevantes de pesquisa em IA. A arquitetura utiliza o Hugging Face Jobs, Storage Buckets e Inference Endpoints para gerenciar o pipeline de embeddings e atender consultas com baixa latência.

  • O Hugging Face Jobs fornece computação GPU escalonável para gerar embeddings de mais de 110.000 artigos usando o modelo Qwen/Qwen3-Embedding-0.6B.
  • Os Storage Buckets atuam como armazenamento durável entre exportações do banco de dados, processamento de jobs e importação de índices.
  • Os Inference Endpoints fornecem embeddings com baixa latência para consultas em tempo real, caindo para recuperação por texto completo se não estiverem disponíveis.
  • O sistema utiliza fusão de classificação recíproca (RRF) para combinar a busca lexical do PostgreSQL com a busca vetorial densa do pgvector.
  • Um contrato rigoroso de embeddings garante reprodutibilidade ao versionar a revisão do modelo, o formato de entrada e o método de normalização.

Essa separação entre a construção offline do corpus e os serviços de busca online permite que a plataforma mantenha tanto alta qualidade de recuperação quanto tempos de resposta rápidos para pesquisadores.