
« Domestication des tokens aberrants dans les transformeurs de diffusion »
Des chercheurs se sont penchés sur un phénomène technique observé dans les Diffusion Transformers (DiT), les architectures qui alimentent aujourd'hui la génération d'images par IA. Des travaux antérieurs avaient déjà montré que les Vision Transformers (ViT) classiques produisent parfois un petit nombre de tokens dits "à norme élevée", des unités de traitement internes qui captent une attention disproportionnée du modèle tout en transportant peu d'information locale utile sur l'image. Ce que l'équipe démontre ici, c'est que ce même phénomène se retrouve dans les pipelines récents combinant un Representation Autoencoder (RAE) et un DiT, à la fois côté encodeur et côté "débruiteur" (denoiser). Les encodeurs ViT pré-entraînés génèrent eux-mêmes des représentations aberrantes, et les DiT peuvent développer leurs propres tokens atypiques en interne, surtout dans les couches intermédiaires du réseau.
Cette découverte compte parce que les tokens aberrants perturbent potentiellement la façon dont le modèle répartit son attention pendant la génération, au détriment des informations réellement pertinentes pour construire l'image. Mieux comprendre et corriger ce biais pourrait améliorer la qualité, la cohérence et l'efficacité des générateurs d'images basés sur les DiT, une famille de modèles au cœur des systèmes de génération visuelle les plus avancés actuellement déployés dans l'industrie.
Le sujet s'inscrit dans une réflexion plus large sur l'interprétabilité des transformers, initiée par les recherches sur les ViT dans les tâches de classification d'images, mais restée jusqu'ici peu explorée dans le contexte génératif. En identifiant précisément où et comment ces tokens aberrants apparaissent dans les architectures RAE-DiT, les auteurs ouvrent la voie à des méthodes de correction ciblées, susceptibles d'influencer la conception des prochaines générations de modèles de génération d'images.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




