Aller au contenu principal
Recherche · Paper ·

Un chercheur de Princeton propose le Recurrent Looped Transformer (RLT), qui conserve l'état du décodeur à chaque token avec 96 blocs fixes et une profondeur temporelle illimitée

Un chercheur de Princeton, Yifan Zhang, propose dans un rapport technique une nouvelle architecture baptisée Recurrent Looped Transformer (RLT), conçue pour faire circuler l'état interne d'un modèle de langage d'un token à l'autre. Dans les décodeurs classiques, l'état calculé à la dernière couche pour un token n'est jamais transmis directement au token suivant : seule l'attention sur les clés et valeurs mises en cache assure la communication entre positions. Le RLT associe un encodeur causal, qui traite les tokens en parallèle et produit des représentations projetées en mémoire clé-valeur, à un décodeur récurrent dont l'état complet (sortie finale et cache d'attention à fenêtre glissante à chaque couche) est reporté d'un token à l'autre, sans réinitialisation entre le prompt et la réponse. Dans la configuration de référence, 48 couches d'encodeur et 48 couches de décodeur partagent des poids compatibles, ce qui porte à 96 le nombre de blocs logiques exécutés par token. Zhang précise qu'il s'agit d'une réutilisation de paramètres et non d'une simple copie d'activations. Le rapport ne présente aucune mesure d'efficacité, de qualité de raisonnement ou de passage à l'échelle : c'est une spécification architecturale, pas une évaluation empirique.

2 min de lecturePertinence 40

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

L'enjeu principal de cette proposition est de permettre une profondeur temporelle de raisonnement non bornée tout en gardant un coût de calcul fixe par token. Après le traitement de t tokens, le chemin d'état depuis l'origine traverse 48×t blocs de décodeur dans la configuration de référence, ce qui signifie que la profondeur structurelle du calcul croît avec la longueur de la séquence, sans augmenter le travail requis pour chaque nouveau token. Pour l'industrie des grands modèles de langage, cela ouvrirait une voie alternative à l'augmentation de la taille des modèles ou du contexte pour améliorer le raisonnement, en misant plutôt sur la profondeur temporelle cumulée. Mais Zhang lui-même tempère cette promesse : les mécanismes de porte et de contraction du réseau peuvent supprimer l'information portée par ces longs chemins, donc une profondeur structurelle élevée ne garantit en rien un raisonnement plus performant. Aucune accélération de préremplissage n'est revendiquée, et le rapport indique explicitement qu'un passage parallèle standard d'un décodeur à fenêtre glissante n'équivaut pas à cette récurrence.

Le rapport détaille aussi comment cette architecture s'articule avec l'entraînement par renforcement et le matériel. Pour le co-design algorithmique, le pré-entraînement, le fine-tuning supervisé, l'échantillonnage et le replay en RL partagent une même transition d'état : lors de l'entraînement RL, l'échantillonneur enregistre les probabilités réelles de chaque action, puis l'entraîneur reconstruit intégralement la mémoire et les caches depuis le début de la séquence avant de noter chaque action, sans jamais réutiliser d'anciens états. Côté matériel, les calculs d'encodeur restent parallélisables par token, mais les transitions du décodeur demeurent séquentielles au sein d'une même séquence, même si des mises à jour de séquences indépendantes peuvent être regroupées en un seul noyau de calcul batché. Le fine-tuning supervisé masque la perte sur les cibles de l'assistant mais jamais les mises à jour d'état, de sorte que les gradients remontent aussi à travers les tokens utilisateur et outils, un point que le rapport juge délicat à gérer avec des schémas de rétropropagation tronquée dans le temps. Cette proposition s'inscrit dans une recherche plus large de mécanismes de mémoire et de récurrence pour dépasser les limites des transformeurs purement attentionnels.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Construire des Transformers à profondeur récurrente avec OpenMythos : MLA, GQA, Sparse MoE et raisonnement itératif36MarkTechPostRecherche 02Les maths demandent du temps de réflexion, la connaissance du quotidien demande de la mémoire, une nouvelle architecture Transformer vise à combiner les deux45The DecoderRecherche 03Stanford présente TRACE, un système d'entraînement d'agents ciblé sur les compétences qui transforme leurs échecs récurrents en environnement RL synthétique36MarkTechPostRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.