Nunchux AI dévoile VC-Attention, un noyau d'attention low-bit sans entraînement qui accélère les transformeurs de diffusion vidéo
Nunchux AI a présenté VC-Attention, un noyau d'attention à faible précision numérique conçu pour accélérer les modèles de diffusion transformeurs (DiT) vidéo, sans nécessiter le moindre réentraînement. L'outil s'attaque à deux goulots d'étranglement bien identifiés du calcul d'attention : les erreurs de quantification sur les valeurs et la lenteur de l'étape softmax. Le problème est concret : un clip de cinq secondes en 720p généré par Wan2.2-14B représente environ 70 000 tokens spatio-temporels, et sur une RTX 5090 le calcul d'attention occupe plus de 64 % du temps de génération total ; sur un GPU B200, il représente environ les deux tiers de chaque étape de débruitage du modèle MiniMax-H3. VC-Attention combine deux techniques, V-Smooth et ExpCast-FP8, testées sur quatre modèles vidéo ouverts (Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5, MiniMax-H3) avec une évaluation de fidélité sur 100 prompts face à une référence BF16 FlashAttention-4.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Les gains mesurés sont substantiels : sur un GPU B200, l'attention est accélérée 1,59 fois en 8 bits, pour un gain de bout en bout de 1,19 fois, et jusqu'à 3,58 fois sur une RTX 5090 en 4 bits, pour un gain global de 1,70 fois. Face à SageAttention2, la référence du secteur, VC-Attention va jusqu'à 6,02 fois plus vite sur B200, une carte pour laquelle SageAttention2 ne propose aucun noyau optimisé. Ces accélérations n'entament pas la qualité : en 8 bits, V-Smooth gagne 2,3 dB de PSNR sur Wan2.2 et 2,8 dB sur HunyuanVideo-1.5 par rapport à SageAttention2, et en 4 bits il dépasse SageAttention3 de 2,9 dB sur Wan2.2 et 3,6 dB sur LongCat-Video. L'enjeu est direct pour l'industrie de la vidéo générée par IA, où le coût de l'attention croît avec le carré du nombre de tokens : le réduire sans réentraînement ni perte de qualité rend la production vidéo plus rapide et moins coûteuse à grande échelle.
Techniquement, V-Smooth comble un angle mort des méthodes existantes comme SageAttention2 : une fois les requêtes et les clés lissées, les valeurs concentrent à elles seules 82 % de l'erreur de sortie sur Wan2.2, un défaut qu'une simple rotation de Hadamard ne corrige pas. La méthode regroupe les tokens par k-means en ligne, retire la moyenne de chaque bloc de 128 tokens avant quantification puis la restaure via le softmax, pour un surcoût de 3 à 4 % du temps d'attention. ExpCast-FP8 règle de son côté le goulot du softmax en écrivant directement l'octet FP8 depuis le score logarithmique, une optimisation CUDA qui fait passer un appel V-Smooth de 42,2 à 4,8 millisecondes sur B200. Ces travaux s'inscrivent dans une course à la quantification bas-bit de l'attention face à SageAttention2, SageAttention3 et l'entraînement quantifié Attn-QAT, alors que les GPU Blackwell et Hopper misent sur des Tensor Cores FP8 et FP4 pour la génération vidéo par IA.
Pas d'impact direct sur la France/UE