Tencent open-source AngelSpec, un framework unifié d'entraînement pour le MTP et le décodage spéculatif parallèle par blocs sur les modèles Hy3
Tencent a publié en open source AngelSpec, un framework d'entraînement natif PyTorch destiné à construire des modèles "brouillons" (draft models) pour le décodage spéculatif, une technique qui accélère l'inférence des grands modèles de langage. La publication couvre deux familles de méthodes appliquées aux modèles Hy3 de l'entreprise : la prédiction multi-tokens autorégressive (MTP) et la famille DFlash/DFly, basée sur un décodage par blocs parallèles. Le principe du décodage spéculatif est le suivant : un petit modèle propose plusieurs tokens futurs, puis le modèle cible les vérifie tous en un seul passage, sans perte de qualité. Les gains dépendent de deux facteurs, le taux d'acceptation des propositions et la durée du cycle proposition-vérification. Sur le module MTP, Tencent a mesuré qu'à température nulle, le taux d'acceptation moyen passe de 52,8 % à 66,4 % et la longueur moyenne acceptée de 2,58 à 2,99 tokens, avec des gains particulièrement marqués en profondeur : le taux à la troisième position grimpe de 29 % à 70,6 % sur le benchmark GSM8K et de 38,7 % à 75,7 % sur HumanEval.
L'intérêt de cette approche est qu'elle refuse l'idée d'un modèle brouillon universel, jugée inadaptée au trafic réel des serveurs. Dans une conversation ouverte à forte entropie, de nombreuses continuations sont valides, ce qui fait chuter rapidement l'acceptation dès que le brouillon s'allonge ; la prédiction autorégressive courte, comme le MTP, convient mieux à ce cas. À l'inverse, le code informatique et les raisonnements mathématiques suivent des structures syntaxiques et logiques très contraintes, qui permettent de générer des séquences prévisibles plus longues, exploitées efficacement par le décodage par blocs. En proposant deux modèles complémentaires spécialisés plutôt qu'un compromis unique, entraînés sur des données différentes (conversation généraliste pour le MTP, code et mathématiques pour DFly), Tencent promet une inférence plus rapide et moins coûteuse pour les entreprises qui déploient des modèles de langage à grande échelle, un enjeu économique majeur dans la course actuelle à la réduction des coûts de calcul.
Sur le plan technique, AngelSpec s'appuie sur le principe du "Training-Time Test" introduit par EAGLE-3 : le bloc MTP, entraîné en boucle sur plusieurs profondeurs avec des paramètres partagés, reçoit à chaque étape la prédiction la plus probable de l'étape précédente plutôt que le token de référence, ce qui réduit l'écart entre entraînement et inférence. Le backbone et la tête de langage du modèle cible restent gelés, et l'entraînement utilise des réponses générées par ce même modèle cible plutôt que par un corpus externe, afin de reproduire fidèlement ses schémas d'incertitude. DFly, la variante par blocs, hérite de l'architecture DFlash avec un mécanisme de conditionnement hybride sur les couches cibles. Ces choix, documentés et rendus publics, s'inscrivent dans une compétition plus large entre laboratoires pour optimiser la vitesse de service des grands modèles, aux côtés d'acteurs comme NVIDIA ou les équipes derrière EAGLE.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




