AdaSpark est un ordonnanceur pour les générateurs de blocs comme DSpark qui apprend les largeurs de vérification et les probabilités d'acceptation pendant le service, sans profilage ni calibration préalables. Il ajuste le temps de vérification en fonction du contexte et de l'acceptation des candidats par rapport aux résultats du modèle cible, permettant aux candidats générés et dérivés du texte de concourir dans un seul ordre best-first.

  • Sur six ensembles de données publics avec trois cibles denses et une cible à mélange d'experts, AdaSpark décoder 1,5 à 3,1 fois plus vite que DSpark de llama.cpp en utilisant les mêmes générateurs.
  • Le moteur imparo avec AdaSpark est 1,17 à 1,52 fois plus rapide qu'en exécutant une chaîne par défaut de trois jetons, un gain attribué uniquement à l'ordonnanceur.
  • Sans balayages de largeur, les performances restent dans les 0,3 % de la meilleure largeur d'arbre fixe sur les cibles denses et égalent la meilleure largeur fixe sur les modèles à mélange d'experts.

Cette approche élimine le besoin de calibration hors ligne ou de balayages tout en offrant des accélérations significatives par rapport aux méthodes d'ordonnancement standard.