PaddlePaddle a présenté HPD-Parsing, un modèle léger de parsing de documents comptant 1 milliard de paramètres qui exploite un paradigme de décodage parallèle hiérarchique pour améliorer le débit. L'architecture coordonne la structure globale des pages via une branche de mise en page principale tout en répartissant la génération de contenu localisé vers des branches concurrentes, en utilisant la prédiction multi-jetons progressive pour réduire les étapes de décodage.

  • HPD-Parsing obtient un score global de 94,91 % sur OmniDocBench v1.6, établissant un nouvel état de l'art parmi les analyseurs unifiés de bout en bout.
  • Le modèle atteint un débit maximal de 4 752 jetons par seconde (TPS), ce qui est 3,06 fois plus rapide que sa base de référence autoregressive et 2,62 fois plus rapide que l'analyseur de documents existant le plus rapide.
  • Une stratégie d'adaptation par étapes avec une curation automatisée des données consciente de la difficulté préserve la précision du parsing lors de la transition vers le décodage parallèle.

Cette approche démontre que le parsing de documents peut être exécuté efficacement grâce à la coordination de la mise en page globale et au décodage parallèle localisé plutôt qu'à une trajectoire de génération séquentielle unique.