Aller au contenu principal
Recherche · Paper ·

Nunchux AI dévoile VC-Attention, un noyau d'attention low-bit sans entraînement qui accélère les transformeurs de diffusion vidéo

Nunchux AI a présenté VC-Attention, un noyau d'attention à faible précision numérique conçu pour accélérer les modèles de diffusion transformeurs (DiT) vidéo, sans nécessiter le moindre réentraînement. L'outil s'attaque à deux goulots d'étranglement bien identifiés du calcul d'attention : les erreurs de quantification sur les valeurs et la lenteur de l'étape softmax. Le problème est concret : un clip de cinq secondes en 720p généré par Wan2.2-14B représente environ 70 000 tokens spatio-temporels, et sur une RTX 5090 le calcul d'attention occupe plus de 64 % du temps de génération total ; sur un GPU B200, il représente environ les deux tiers de chaque étape de débruitage du modèle MiniMax-H3. VC-Attention combine deux techniques, V-Smooth et ExpCast-FP8, testées sur quatre modèles vidéo ouverts (Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5, MiniMax-H3) avec une évaluation de fidélité sur 100 prompts face à une référence BF16 FlashAttention-4.

2 min de lecturePertinence 52

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Les gains mesurés sont substantiels : sur un GPU B200, l'attention est accélérée 1,59 fois en 8 bits, pour un gain de bout en bout de 1,19 fois, et jusqu'à 3,58 fois sur une RTX 5090 en 4 bits, pour un gain global de 1,70 fois. Face à SageAttention2, la référence du secteur, VC-Attention va jusqu'à 6,02 fois plus vite sur B200, une carte pour laquelle SageAttention2 ne propose aucun noyau optimisé. Ces accélérations n'entament pas la qualité : en 8 bits, V-Smooth gagne 2,3 dB de PSNR sur Wan2.2 et 2,8 dB sur HunyuanVideo-1.5 par rapport à SageAttention2, et en 4 bits il dépasse SageAttention3 de 2,9 dB sur Wan2.2 et 3,6 dB sur LongCat-Video. L'enjeu est direct pour l'industrie de la vidéo générée par IA, où le coût de l'attention croît avec le carré du nombre de tokens : le réduire sans réentraînement ni perte de qualité rend la production vidéo plus rapide et moins coûteuse à grande échelle.

Techniquement, V-Smooth comble un angle mort des méthodes existantes comme SageAttention2 : une fois les requêtes et les clés lissées, les valeurs concentrent à elles seules 82 % de l'erreur de sortie sur Wan2.2, un défaut qu'une simple rotation de Hadamard ne corrige pas. La méthode regroupe les tokens par k-means en ligne, retire la moyenne de chaque bloc de 128 tokens avant quantification puis la restaure via le softmax, pour un surcoût de 3 à 4 % du temps d'attention. ExpCast-FP8 règle de son côté le goulot du softmax en écrivant directement l'octet FP8 depuis le score logarithmique, une optimisation CUDA qui fait passer un appel V-Smooth de 42,2 à 4,8 millisecondes sur B200. Ces travaux s'inscrivent dans une course à la quantification bas-bit de l'attention face à SageAttention2, SageAttention3 et l'entraînement quantifié Attn-QAT, alors que les GPU Blackwell et Hopper misent sur des Tensor Cores FP8 et FP4 pour la génération vidéo par IA.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Nous Research propose Lighthouse Attention : une attention hiérarchique par sélection qui accélère le pré-entraînement de 1,4 à 1,7× sur les longs contextes39MarkTechPostRecherche 02Le calibrage de l'attention creuse accélère la génération de texte en vidéo37Apple Machine LearningRecherche 03Nous Research publie une méthode d'entraînement par superposition de tokens qui accélère le pré-entraînement des LLM jusqu'à 2,5x pour des modèles de 270M à 10B paramètres41MarkTechPostRecherche 
Dossier · BlackwellSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.