Alibaba lance Qwen3.8-Omni-Flash, un modèle omni-modal à 1M de contexte pour l'audio-vidéo et l'usage d'outils avec des agents
Alibaba a dévoilé Qwen3.8-Omni-Flash, présenté par son équipe Qwen comme son premier modèle omni-modal conçu autour de capacités agentiques. Le système accepte du texte, des images, de l'audio et de la vidéo en entrée, et produit uniquement du texte en sortie. Bâti sur l'architecture Qwen3.8-Flash-Next, diffusée en open source en août 2026, il offre une fenêtre de contexte d'un million de tokens, avec un maximum de 991 000 tokens en entrée et 131 000 en sortie selon QwenCloud, pour une longueur de raisonnement plafonnée à 262 000 tokens. Le raisonnement est activé par défaut avec un niveau d'effort réglé sur "xhigh". Le modèle est accessible dès aujourd'hui via API hébergée sur QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, dans six régions (Pékin, Singapour, Hong Kong, Tokyo, Francfort et Virginie), mais aucun poids ouvert n'a été publié, rendant l'auto-hébergement impossible. Sur le plan tarifaire, QwenCloud facture 0,15 dollar par million de tokens en entrée et 0,47 dollar par million en sortie, avec un accès en cache à 0,016 dollar par million de tokens.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'apport principal du modèle réside dans sa perception agentique pour la vidéo longue : plutôt que de lire un fichier du début à la fin, l'agent part de la question posée, décide quoi regarder et écouter, puis rassemble des preuves par cycles successifs allant du général au précis, concentrant ainsi le calcul sur les segments pertinents. Sur le benchmark OmniVideoBench, cette approche fait passer la précision de 63,4 à 67,8 tout en réduisant l'usage de tokens de 145 736 à 79 117, soit environ 45,7% d'économie. Qwen revendique aussi des baisses de coûts massives par rapport à son précédent modèle Qwen3.5-Omni-Plus, avec plus de 98% de réduction pour l'audio, plus de 93% pour l'audio-visuel et environ 89% pour la vidéo selon Alibaba. Pour les entreprises qui déploient des agents multimodaux à grande échelle, cette efficacité de traitement change concrètement l'équation économique, en particulier pour l'analyse de vidéos longues où le coût en tokens était jusqu'ici prohibitif.
Ces gains restent toutefois à confirmer par des tests indépendants, puisque tous les chiffres proviennent des propres évaluations de Qwen : sur 29 benchmarks, le score moyen s'améliore de plus de 25% par rapport à Qwen3.5-Omni-Plus, avec des progressions notables comme +36,5 points sur WildClawBench-MM ou +22,3 points sur AgenticVBench. L'équipe affirme que les performances audio-visuelles se rapprochent de Gemini 3.8 Flash et que les performances audio globales le dépassent, signe de la concurrence directe qu'Alibaba entend mener face à Google sur ce segment. Le modèle prend en charge 113 langues et dialectes en entrée audio, des vidéos jusqu'à deux heures et deux gigaoctets, ainsi que l'audio spatial stéréo et FOA à quatre canaux. Il s'intègre via les protocoles DashScope et OpenAI, avec prise en charge de l'appel de fonctions, de la recherche web et du traitement par lots, positionnant Qwen dans la course mondiale aux modèles agentiques multimodaux aux côtés d'OpenAI et Google.
Le service est accessible via un datacenter à Francfort, ce qui permet aux entreprises européennes d'y accéder avec une latence réduite mais sans impact réglementaire ou concurrentiel direct sur la France/UE.