Des chercheurs de NVIDIA présentent Physis-Lang, un langage physique auto-évolutif qui place Cosmos 3 devant Veo 3.1 sur les benchmarks de physique
Des chercheurs de NVIDIA, du MIT et de l'Université d'Oxford ont présenté Physis-Lang, un cadre qui traite le langage physique comme une représentation partagée et optimisable, utilisée à la fois pour la sélection des données, l'entraînement et l'inférence des modèles de monde vidéo. Sur le classement public Physics-IQ Verified, dans sa version du 29 septembre 2026, Physis-Lang appliqué à Cosmos3-Super arrive premier avec 48,2 ± 1,4, et la version Cosmos3-Nano se classe deuxième avec 43,3 ± 1,5. Le système ajoute à chaque légende de base un champ de raisonnement physique décrivant les entités, les causes, les interactions, les principes en jeu, l'évolution temporelle et les effets, ainsi qu'un « prompt négatif » propre à la scène qui décrit les issues improbables, comme une pierre flottant sur l'eau. Une boucle d'auto-évolution fait travailler un captioneur GPT-5.5 figé, dont seule la consigne est réécrite par un agent, sous le contrôle de Gemini-3.1-Pro comme critique physique, sur 20 vidéos et 273 assertions vérifiées par des humains. Validé sur PhysCapBench (246 vidéos, 3 794 assertions), le score F1 des légendes passe de 78,64 à 87,82 en neuf itérations. Le jeu d'entraînement final réunit 183 000 vidéos, dont 71 000 issues de WISA-80K et 112 000 clips récupérés selon leur contenu physique. Le réglage fin repose sur LoRA, sans changement d'architecture.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Les résultats montrent qu'un gain de plausibilité physique peut venir du texte seul, sans signal visuel, latent ou numérique supplémentaire. Face à Veo 3.1 de Google, Cosmos3-Nano avec Physis-Lang obtient 71,04 contre 65,63 sur PhyGenBench, 43,41 contre 34,99 sur Physics-IQ Verified et 69,90 contre 69,24 sur PhyGround. Sur VideoPhy-2, il fait un peu moins bien sur l'ensemble (68,02 contre 68,87) mais l'emporte sur la partie difficile (62,36 contre 58,43). Les progrès se retrouvent sur plusieurs architectures : +7,05 pour Wan2.1-14B, +3,24 pour Cosmos3-Edge-4B, +6,22 pour Cosmos3-Nano-16B et +5,02 pour Cosmos3-Super-64B, tandis que la qualité générale reste stable sur VBench-I2V (88,32 contre 88,69). Le simple prompting aide aussi : le raisonnement physique associé aux prompts négatifs fait passer un Cosmos3-Nano gelé de 61,67 à 67,29 sur PhyGenBench. Les chercheurs ont enfin distillé le pipeline GPT dans deux modèles Qwen3-VL-4B-Instruct, PhysThinker-C pour la légende et PhysThinker-U pour l'enrichissement des prompts, afin de se passer d'API commerciales, dont le coût sur Wan2.1-14B avoisinait 24 dollars pour un gain de 7,05 points.
Ces travaux s'inscrivent dans un problème connu des modèles de monde vidéo : ils produisent des clips convaincants qui violent pourtant la physique, avec du beurre qui s'étale comme de la peinture ou des balles traversant des murs. Les légendes classiques décrivent ce qui se passe sans expliquer pourquoi, ce qui prive l'entraînement d'un signal causal. En optimisant le langage plutôt que l'architecture, l'équipe propose une voie peu coûteuse, compatible avec des modèles existants et ouverte, face à des systèmes propriétaires comme Veo 3.1. Le recours à des modèles de 4 milliards de paramètres ouvre aussi la porte à des reproductions sans dépendance à OpenAI ou Google. Reste à voir si l'approche tiendra sur des benchmarks plus variés et si les gains se confirmeront hors des catégories physiques ciblées par la sélection de données.
Pas d'impact direct sur la France/UE