Aller au contenu principal
LLMs · Actu ·

DeepSeek v4.1-Flash : une architecture encodeur-décodeur inédite avec vision marque le retour de la baleine

DeepSeek a lancé le 9 septembre 2026 un nouveau modèle open-weight baptisé V4.1-Flash, qui remplace en réalité l'ancien V4 Pro malgré son nom trompeur suggérant une simple mise à jour mineure. Le modèle repose sur une architecture encodeur-décodeur causale entièrement nouvelle, totalisant 763 milliards de paramètres, avec seulement 8 milliards de paramètres actifs pour le traitement des entrées (prefill) et 16 milliards pour la génération des sorties (décodé), soit un taux de sparsité de seulement 1 à 2%. Il intègre nativement la vision, sans nécessiter de modèle séparé, gère un contexte d'un million de tokens et est distribué sous licence MIT avec disponibilité API aux États-Unis. Selon le cabinet Artificial Analysis, V4.1-Flash dépasse déjà l'ancien V4 Pro (version 0813) avec un score de 40 sur son Intelligence Index, se plaçant juste derrière GLM-5.3-Flash. Son prix est fixé à 0,30 dollar par million de tokens en entrée et 1,20 dollar par million en sortie, avec un tarif réduit à 0,006 dollar pour les entrées mises en cache, plus une remise supplémentaire de 50% aux heures creuses.

2 min de lecturePertinence 59

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →

L'enjeu principal ne réside pas dans les benchmarks bruts, où le modèle reste techniquement derrière certains concurrents, mais dans son efficacité d'inférence radicalement améliorée. La séparation entre les paramètres actifs au prefill et au décodé, combinée à une nouvelle technique appelée Sliding-Window Attention Bounded Replay, réduit l'empreinte du cache KV jusqu'à un huitième de celle de V4 Flash. Concrètement, cela rend le modèle beaucoup plus rapide et moins coûteux à faire tourner pour des agents IA fonctionnant en continu sur de longues durées, un cas d'usage central pour les entreprises qui déploient des agents autonomes. Pour l'industrie, cela signifie une baisse potentielle des coûts d'exploitation des applications agentiques et une pression concurrentielle accrue sur les fournisseurs de modèles propriétaires, alors que DeepSeek propose ces avancées en open source sous licence permissive MIT.

Ce lancement marque le retour remarqué de DeepSeek sur le devant de la scène après une année de relatif silence, période durant laquelle des concurrents chinois comme GLM et Kimi avaient pris l'ascendant sur le marché des modèles ouverts, dans la foulée du succès retentissant du modèle R1 au premier semestre 2025. Entre les versions majeures V2, V3 et V4, DeepSeek a l'habitude de publier des recherches intermédiaires très ciblées, portant par exemple sur les mathématiques via la méthode GRPO, la génération de code, ou plus récemment des techniques comme les Manifold Constrained Hyperconnections et la Compressed Sparse Attention. Les commentaires de l'entreprise sur l'entraînement post-hoc du modèle rejoignent par ailleurs les positions du professeur Jie Tang, suggérant une convergence des grands laboratoires chinois sur certaines méthodologies. Le lancement intervient aussi dans un contexte où la communauté surveille de près la capacité de DeepSeek à retrouver son rôle de pionnier architectural, un an après avoir cédé le devant de la scène.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes déployant des agents IA pourraient réduire leurs couts d'inférence en adoptant ce modèle open-weight sous licence MIT.

À lire ensuite

01DeepSeek-V4.1-Flash : DeepSeek lance un modèle plus compact, mais bien plus rapide52Le Big DataLLMs 02DeepSeek publie en accès libre V4-Flash 0731, une mise à jour post-entraînement qui dépasse V4-Pro sur les benchmarks d'agents46Latent SpaceLLMs 03Le nouveau modèle DeepSeek V4.1-Flash réduit les besoins en mémoire des agents IA53The DecoderLLMs 
Dossier · Agents IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.