Au-delà de la CoT visuelle : une pensée visuelle interne pour un raisonnement vidéo proactif
Des chercheurs présentent Internalized Visual Thinking (IVT), une nouvelle méthode d'entraînement pour les grands modèles multimodaux de langage appliqués au raisonnement vidéo. Ce travail s'attaque aux limites du Visual Chain-of-Thought (Visual CoT), une technique qui pousse un modèle à générer des images intermédiaires pour raisonner sur l'espace, le temps ou des scènes incarnées avant de produire sa réponse finale. Si cette méthode donne aux modèles une forme d'anticipation visuelle intuitive, elle alourdit considérablement le temps de calcul nécessaire au moment de l'inférence, un problème particulièrement gênant pour le raisonnement vidéo dit proactif, où le système doit réagir en continu à un flux d'images. IVT propose une alternative : entraîner conjointement la prédiction textuelle et la génération d'images de raisonnement pendant la phase d'entraînement, afin que le modèle intériorise cette capacité de pensée visuelle sans avoir à produire ces images intermédiaires une fois déployé.
Résumé et traduction réalisés par Le Fil IA à partir de Apple Machine Learning. Lire l'article original →
L'enjeu est direct pour toute application vidéo en temps réel, robotique, assistance visuelle, surveillance intelligente ou systèmes embarqués, où chaque milliseconde de calcul compte. En supprimant la génération explicite d'images à l'inférence tout en conservant la qualité de raisonnement qu'elle procure, IVT laisse entrevoir des modèles capables d'anticiper des événements dans une vidéo sans le surcoût matériel qui freinait jusqu'ici leur usage pratique à grande échelle.
Cette approche s'inscrit dans une tendance plus large de la recherche en IA multimodale, où le raisonnement par étapes intermédiaires, hérité du chain-of-thought textuel des grands modèles de langage, s'étend désormais à l'image et à la vidéo. La difficulté centrale reste d'équilibrer profondeur de raisonnement et latence, un compromis que les techniques de post-entraînement comme IVT cherchent précisément à résoudre en déplaçant le coût de calcul de l'inférence vers l'entraînement.
Pas d'impact direct sur la France/UE