Aller au contenu principal
LLMs · Actu ·

DeepSeek-V4.1-Flash : DeepSeek lance un modèle plus compact, mais bien plus rapide

Jeudi 10 septembre 2026, DeepSeek a dévoilé DeepSeek-V4.1-Flash, un nouveau modèle multimodal présenté comme le plus compact de sa nouvelle famille d'architectures. Il totalise 552 milliards de paramètres dans une conception de type mélange d'experts, mais repose sur une architecture inédite dite Causal Encoder-Decoder qui n'active que 8 milliards de paramètres pour traiter les données en entrée et 16 milliards pour générer la sortie. Cette asymétrie réduit fortement la charge de calcul et accélère les réponses, tout en intégrant nativement la compréhension d'images. Le modèle gère une fenêtre de contexte d'un million de tokens et peut produire jusqu'à 384 000 tokens en sortie. DeepSeek annonce aussi un cache KV quatre fois moins gourmand en mémoire HBM et huit fois moins en stockage SSD que la génération précédente. Côté tarifs, l'entreprise instaure un système d'heures pleines et creuses : en entrée avec cache, le prix hors pointe tombe à 0,003 dollar par million de tokens, contre 0,15 dollar sans cache, tandis que la génération coûte 0,60 dollar par million de tokens. Le modèle est publié en libre accès sur Hugging Face, accompagné d'un rapport technique complet.

2 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Le Big Data. Lire l'article original →

Cette annonce confirme la stratégie de DeepSeek : proposer des modèles toujours plus efficaces et moins chers pour concurrencer les géants américains sur le terrain du rapport coût-performance plutôt que sur la seule puissance brute. En divisant fortement la consommation mémoire et en réduisant les tarifs hors pointe, l'entreprise chinoise cible directement les développeurs et entreprises qui déploient des applications à grande échelle, en particulier les agents autonomes qui manipulent de longs contextes textuels de façon répétée. La publication en open source, associée à un appel lancé à la communauté disposant de clusters de 2 000 GPU pour explorer de nouvelles options de déploiement, illustre la volonté de DeepSeek d'élargir l'écosystème autour de ses modèles plutôt que de les enfermer dans une offre propriétaire fermée. Pour les entreprises technologiques, cette baisse des coûts d'inférence ouvre la voie à des usages plus intensifs de l'IA générative sans faire exploser les budgets.

Cette sortie s'accompagne d'une consolidation rapide du catalogue de DeepSeek. L'entreprise retire simultanément les modèles V4-Flash et V4-Flash-Vision-Exp, dont les requêtes seront automatiquement redirigées vers la nouvelle version. Le modèle V4-Pro suivra dès le 14 septembre 2026, ses requêtes étant elles aussi absorbées par V4.1-Flash. Ce mouvement traduit la volonté de concentrer les efforts sur une architecture unique jugée plus performante plutôt que de maintenir plusieurs lignes de modèles en parallèle. Depuis son irruption sur la scène internationale avec des modèles à très bas coût, DeepSeek continue de bousculer un marché dominé par les acteurs américains comme OpenAI, Google ou Anthropic, misant sur l'innovation architecturale et l'agressivité tarifaire. La suite dépendra de sa capacité à industrialiser ce déploiement via des partenariats d'infrastructure GPU à grande échelle, et de la réaction des concurrents face à cette nouvelle offensive sur les prix.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Le nouveau modèle DeepSeek V4.1-Flash réduit les besoins en mémoire des agents IA56The DecoderLLMs 02Le nouveau modèle V4 de DeepSeek : trois raisons pour lesquelles il compte54MIT Technology ReviewLLMs 03L'IA à base d'agents pousse les prix à la hausse, Deepseek sort un modèle compétitif pour presque rien54The DecoderLLMs 
Dossier · DeepSeek V4Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.