Aller au contenu principal
LLMs · Actu ·

Alibaba lance Qwen3.8-Omni-Flash, un modèle omni-modal à 1M de contexte pour l'audio-vidéo et l'usage d'outils avec des agents

Alibaba a dévoilé Qwen3.8-Omni-Flash, présenté par son équipe Qwen comme son premier modèle omni-modal conçu autour de capacités agentiques. Le système accepte du texte, des images, de l'audio et de la vidéo en entrée, et produit uniquement du texte en sortie. Bâti sur l'architecture Qwen3.8-Flash-Next, diffusée en open source en août 2026, il offre une fenêtre de contexte d'un million de tokens, avec un maximum de 991 000 tokens en entrée et 131 000 en sortie selon QwenCloud, pour une longueur de raisonnement plafonnée à 262 000 tokens. Le raisonnement est activé par défaut avec un niveau d'effort réglé sur "xhigh". Le modèle est accessible dès aujourd'hui via API hébergée sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, dans six régions (Pékin, Singapour, Hong Kong, Tokyo, Francfort et Virginie), mais aucun poids ouvert n'a été publié, rendant l'auto-hébergement impossible. Sur le plan tarifaire, QwenCloud facture 0,15 dollar par million de tokens en entrée et 0,47 dollar par million en sortie, avec un accès en cache à 0,016 dollar par million de tokens.

2 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

L'apport principal du modèle réside dans sa perception agentique pour la vidéo longue : plutôt que de lire un fichier du début à la fin, l'agent part de la question posée, décide quoi regarder et écouter, puis rassemble des preuves par cycles successifs allant du général au précis, concentrant ainsi le calcul sur les segments pertinents. Sur le benchmark OmniVideoBench, cette approche fait passer la précision de 63,4 à 67,8 tout en réduisant l'usage de tokens de 145 736 à 79 117, soit environ 45,7% d'économie. Qwen revendique aussi des baisses de coûts massives par rapport à son précédent modèle Qwen3.5-Omni-Plus, avec plus de 98% de réduction pour l'audio, plus de 93% pour l'audio-visuel et environ 89% pour la vidéo selon Alibaba. Pour les entreprises qui déploient des agents multimodaux à grande échelle, cette efficacité de traitement change concrètement l'équation économique, en particulier pour l'analyse de vidéos longues où le coût en tokens était jusqu'ici prohibitif.

Ces gains restent toutefois à confirmer par des tests indépendants, puisque tous les chiffres proviennent des propres évaluations de Qwen : sur 29 benchmarks, le score moyen s'améliore de plus de 25% par rapport à Qwen3.5-Omni-Plus, avec des progressions notables comme +36,5 points sur WildClawBench-MM ou +22,3 points sur AgenticVBench. L'équipe affirme que les performances audio-visuelles se rapprochent de Gemini 3.8 Flash et que les performances audio globales le dépassent, signe de la concurrence directe qu'Alibaba entend mener face à Google sur ce segment. Le modèle prend en charge 113 langues et dialectes en entrée audio, des vidéos jusqu'à deux heures et deux gigaoctets, ainsi que l'audio spatial stéréo et FOA à quatre canaux. Il s'intègre via les protocoles DashScope et OpenAI, avec prise en charge de l'appel de fonctions, de la recherche web et du traitement par lots, positionnant Qwen dans la course mondiale aux modèles agentiques multimodaux aux côtés d'OpenAI et Google.

Impact France / UEChamp produit par Le Fil IA

Le service est accessible via un datacenter à Francfort, ce qui permet aux entreprises européennes d'y accéder avec une latence réduite mais sans impact réglementaire ou concurrentiel direct sur la France/UE.

À lire ensuite

01L'équipe Qwen d'Alibaba publie Qwen3.5 Omni : un modèle multimodal natif pour le texte, l'audio, la vidéo et l'interaction en temps réel49MarkTechPostLLMs 02Liquid AI lance LFM2.5-2.6B, un modèle embarqué à base d'agents avec contexte 128K, appels d'outils et poids ouverts36MarkTechPostLLMs 03Qwen lance Qwen3.7-Max : un modèle agent de raisonnement avec une fenêtre de contexte d'un million de tokens42MarkTechPostLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.