Tencent a open-sourcé AngelSpec, un framework d'entraînement natif torch qui prend en charge à la fois la prédiction multi-jeton autoregressive (MTP) et les drafters de famille DFlash bloc-parallèles pour les modèles Hy3. Le système traite l'hétérogénéité des charges de travail comme une contrainte de conception principale, lui permettant de spécialiser la structure, les données d'entraînement et la profondeur de vérification en fonction de cas d'utilisation spécifiques.
- AngelSpec comble le décalage entraînement-inférence dans MTP en utilisant un schéma multi-profondeur à paramètres partagés où le bloc physique est déroulé autoregressivement pendant l'entraînement.
- Le framework utilise le rollout du modèle cible et des paramètres de backbone figés pour garantir que le drafter approxime les choix de jetons au moment du service sans altérer les distributions de vérification.
- L'architecture DFly block-diffusion introduit un conditionnement hybride cible et une tête autoregressive conditionnée par prédécesseur pour améliorer les taux d'acceptation dans les domaines du code et des mathématiques.
- Sur Qwen3-8B, DFly atteint une longueur moyenne acceptée de 5.41, surpassant DSpark (5.32), DFlash (4.57) et MTP (3.24).
- Sur Hy3-A21B, DFly atteint une longueur moyenne acceptée de 4.79, représentant des gains relatifs de 29,8 % par rapport à DFlash et de 59,7 % par rapport à MTP.
- Le framework prend en charge l'entraînement sur contexte long jusqu'à 128k tokens et inclut des interfaces plugables pour les cibles, les objectifs et les optimiseurs comme Muon.
AngelSpec fournit un pipeline unifié pour l'entraînement de six architectures drafter, permettant des accélérations significatives du débit en trafic réel tout en maintenant des taux d'acceptation élevés sur divers benchmarks.