« LVSum, un benchmark pour la synthèse de longues vidéos avec repères temporels »
Voici le résumé en français :
Des chercheurs ont présenté LVSum, un nouveau benchmark conçu pour évaluer la capacité des grands modèles multimodaux (MLLM) à résumer des vidéos longues tout en respectant leur chronologie. Le jeu de données rassemble 72 vidéos couvrant 13 domaines différents, pour une durée moyenne de 16 minutes chacune. Chaque vidéo a été annotée manuellement, avec jusqu'à dix résumés produits par des humains et intégrant des références temporelles précises, c'est-à-dire des indications sur le moment exact où se produit chaque événement résumé. Les auteurs ont ensuite mené une évaluation approfondie des modèles multimodaux existants sur cette tâche.
L'enjeu est de taille pour l'industrie de l'IA vidéo : la plupart des modèles actuels peinent à maintenir une cohérence temporelle sur des contenus longs, produisant des résumés qui perdent le fil chronologique ou qui ne peuvent pas être reliés précisément aux passages vidéo correspondants. Un résumé fiable et daté dans le temps est pourtant essentiel pour des usages concrets comme la modération de contenu, l'indexation de vidéothèques, l'accessibilité ou l'analyse automatisée de conférences et de réunions filmées.
Ce travail s'inscrit dans une dynamique plus large de recherche sur la compréhension vidéo par l'IA, où les benchmarks existants se concentrent souvent sur des clips courts ou négligent la dimension temporelle. En proposant des annotations humaines fines et diversifiées par domaine, LVSum vise à combler ce manque et à devenir une référence pour mesurer les progrès des futurs modèles multimodaux sur les vidéos longues, un terrain encore largement à défricher pour les grands laboratoires d'IA.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




