O PaddlePaddle apresentou o HPD-Parsing, um modelo leve de parsing de documentos com 1 bilhão de parâmetros que utiliza um paradigma de Decodificação Paralela Hierárquica para melhorar a taxa de transferência. A arquitetura coordena a estrutura global da página por meio de um ramo principal de layout, enquanto direciona a geração de conteúdo localizado para ramos concorrentes, utilizando Predição Progressiva de Múltiplos Tokens para reduzir as etapas de decodificação.

  • O HPD-Parsing alcança uma pontuação geral de 94,91% no OmniDocBench v1.6, estabelecendo um novo estado da arte entre parsers unificados de ponta a ponta.
  • O modelo atinge uma taxa de transferência máxima de 4.752 Tokens Por Segundo (TPS), que é 3,06 vezes mais rápido que sua linha de base autoregressiva e 2,62 vezes mais rápido que o parser de documentos existente mais rápido.
  • Uma estratégia de adaptação em etapas com curadoria automatizada de dados sensível à dificuldade preserva a precisão do parsing durante a transição para a decodificação paralela.

Esta abordagem demonstra que o parsing de documentos pode ser executado efetivamente por meio da coordenação global do layout e da decodificação paralela localizada, em vez de uma única trajetória de geração sequencial.