LTX-2.5 : les poids ouverts d'un modèle monde accélérés par NVIDIA tiennent sur un seul bureau
La société LTX a lancé LTX-2.5, un modèle de génération vidéo dit "world model" à poids ouverts, conçu pour la production créative, les applications temps réel et l'IA physique. Optimisé pour tourner localement sur les cartes graphiques grand public NVIDIA RTX ainsi que sur le NVIDIA DGX Spark, il réduit fortement les besoins en mémoire vidéo (VRAM), permettant à un modèle de pointe de fonctionner sur du matériel que les créateurs possèdent déjà, directement dans l'interface ComfyUI. La sortie s'inscrit dans une série d'annonces de NVIDIA consacrée à l'IA locale tout au long du mois d'août, et coïncide avec le lancement, le même jour, du modèle d'agents ouvert Nemotron 3.5 Lightning. LTX-2.5 introduit une génération multishot native qui garantit la cohérence d'un personnage ou d'un style sur toute une séquence, s'appuie sur un backbone linguistique Gemma 4 amélioré et un nouveau décodeur limitant les artefacts dans les scènes à mouvement rapide. Sur le plan des performances, LTX affirme qu'un clip de 10 secondes est généré en 6,8 secondes en local sur deux GPU NVIDIA GB200, contre 23,7 secondes via son API. À titre de comparaison, les modèles fermés Omni Flash, Grok 1.5 et Veo 3.1 mettent entre 52 et 70 secondes, tandis que Seedance 2.0, FLUX 3, Seedance 2.5 et Kling 3.0 Pro nécessitent respectivement 196, 259, 317 et 398 secondes, soit un modèle jusqu'à 58 fois plus rapide que le plus lent.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette rapidité change concrètement la manière de produire du contenu vidéo. Un créateur seul ou une petite équipe peut désormais générer, sans frais par clip ni abonnement au cloud, des dizaines de variantes d'une même publicité en une nuit, tester plusieurs accroches et adapter des campagnes à différents marchés avant même que la lassitude publicitaire, qui s'installe généralement en sept à dix jours selon LTX, ne s'installe. La propriété intellectuelle reste sur la machine locale, un argument de poids pour les studios et marques soucieux de confidentialité. Ce qui exigeait auparavant une équipe de tournage, une salle de rendu et une facture cloud tient désormais sur un seul poste équipé d'une carte RTX, avec un fine-tuning LoRA rapide suffisant pour verrouiller un style de marque.
Ce lancement illustre une stratégie plus large de NVIDIA, qui pousse ses modèles ouverts accélérés du PC de bureau aux centres de données. Le même jour, l'entreprise a dévoilé Nemotron 3.5 Lightning, un modèle d'agents à mélange d'experts de 30 milliards de paramètres, ainsi que NeMo Switchyard, une bibliothèque open source qui répartit chaque étape d'un flux d'agents vers le modèle le plus adapté. LTX décrit sa famille de modèles comme fondatrice pour le cinéma, la publicité, le jeu vidéo, la simulation et la robotique, les "world models" cherchant à prédire non pas le mot suivant, comme les modèles de langage, mais le prochain instant d'un environnement simulé.
Les studios et createurs europeens peuvent adopter gratuitement cet outil open source pour produire des videos en local, sans regulation ou acteur francais/europeen implique.