Aller au contenu principal
Infrastructure · Actu ·

Une approche centrée sur le kernel pour la génération vidéo en temps réel sur Trainium

Bryce Schmidtchen, cofondateur et directeur technique de Reactor, une plateforme permettant à des développeurs, designers et chercheurs de déployer et faire évoluer des modèles d'IA interactifs en temps réel, a détaillé une collaboration récente entre Reactor et l'équipe Amazon Neuron Science visant à optimiser la génération vidéo en temps réel sur les puces Trainium d'AWS. Jun Wu, principal applied scientist au sein de l'équipe Neuron, explique que ses collègues ont identifié une évolution du secteur vers des vidéos de longueur infinie ou dynamique, plutôt que des clips courts à durée fixe, ce qui a fait émerger l'usage de modèles de diffusion autoregressifs. Ces modèles combinent la prédiction séquentielle token par token propre aux grands modèles de langage avec le raffinement itératif caractéristique des modèles de diffusion. Reactor opère des centaines de clusters GPU répartis dans le monde entier et s'appuie sur l'infrastructure mondiale d'AWS pour la couche d'inférence.

2 min de lecturePertinence 48

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Amazon Science. Lire l'article original →

Cette optimisation répond à un enjeu concret : produire des flux vidéo en temps réel avec une latence minimale, à grande échelle, sans dégrader la qualité. Selon Schmidtchen, l'efficacité recherchée couvre tout, de l'ordonnancement de l'inférence sur la puce Trainium jusqu'au regroupement maximal des passes de calcul de chaque modèle. Le défi est amplifié par la nature distribuée de l'infrastructure de Reactor : le signal latent qui se transforme en pixel à la sortie du GPU doit atteindre le réseau sans transiter par des couches d'orchestration comme Kubernetes, et ce indépendamment du fait que l'infrastructure sous-jacente soit un cluster géré ou du matériel brut. Cette capacité conditionne directement les usages concrets des modèles de monde, désormais déployés dans la robotique, les transports, la modélisation climatique, le développement de jeux vidéo, la simulation scientifique et le prototypage de design, des secteurs où la réactivité en temps réel devient un prérequis plutôt qu'un luxe.

Le contexte remonte à 1990, lorsque le chercheur Jürgen Schmidhuber a proposé pour la première fois le concept de modèle de monde en apprentissage automatique, puis à 2018, quand il a publié avec David Ha un article fondateur sur un « modèle de monde prédictif » capable d'extraire des représentations utiles de l'espace et du temps pour entraîner des agents, notamment à la conduite. Depuis, l'essor de jeux de données massifs combinés à des autoencodeurs variationnels et à des transformeurs de diffusion ou autorégressifs a permis de convertir texte, image, audio et vidéo en représentations latentes servant à construire des mondes immersifs capables de prédire des changements d'état. Cette montée en puissance des modèles de monde exige désormais une infrastructure matérielle à la hauteur, un terrain sur lequel le partenariat entre Reactor et l'équipe Neuron de Amazon cherche à poser les bases de futurs modèles véritablement temps réel sur Trainium.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01AWS lance une compétition Trainium Frontier pour co-concevoir modèles et kernels sur puces IA dédiées36Amazon ScienceInfrastructure 02Comment Jamf a mis en place le contrôle des dépenses en temps réel pour Amazon Bedrock33AWS ML BlogInfrastructure 03Comment Jumio a construit un feature store en temps réel sur AWS31AWS ML BlogInfrastructure 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.