DeepSeek publie en accès libre V4-Flash 0731, une mise à jour post-entraînement qui dépasse V4-Pro sur les benchmarks d'agents
Le 31 juillet 2026, DeepSeek a lancé en bêta publique l'API DeepSeek-V4-Flash 0731, une mise à jour uniquement post-entraînement, sans changement d'architecture ni de taille du modèle, qui reste à 284 milliards de paramètres au total dont 13 milliards actifs, avec une fenêtre de contexte d'un million de tokens. Selon Artificial Analysis, le score du modèle sur son index composite est passé de 40 à 50 points, le plaçant à seulement un point de GPT-5.6 Luna (51), mais avec un coût par tâche environ 60% inférieur sur l'API propriétaire de DeepSeek, facturée 0,14 et 0,28 dollar par million de tokens en entrée et sortie, avec une remise agressive de 98% sur le cache ramenant le prix à 0,0028 dollar par million de tokens mis en cache. Les gains en capacités agentiques sont particulièrement marqués : le score Terminal-Bench grimpe à 82,7, en hausse de 25,8 points par rapport à la version preview d'avril qui affichait 56,9, tandis que le score GDPval-AA v2 Elo bondit de 1189 à 1559. Les poids du modèle ont été publiés immédiatement en open source sous licence MIT sur Hugging Face, avec un déploiement local rendu possible grâce à des versions quantifiées ne nécessitant qu'environ 168 Go de RAM en 4 bits sans perte de qualité, ou 110 Go en 3 bits.
Cette annonce relance la pertinence de DeepSeek après plus d'un an de relative discrétion, dans la foulée de sa levée de fonds pré-IPO de 70 milliards de dollars. Elle intervient aussi en pleine guerre des prix dans l'industrie, un jour seulement après qu'OpenAI a réduit les tarifs de GPT-5.6 Luna de 80% et ceux de Terra de 20%, ce que plusieurs observateurs interprètent comme une réponse directe et immédiate de DeepSeek. Pour les entreprises et développeurs qui déploient des agents IA à grande échelle, cette compression des coûts change concrètement l'équation économique : un modèle quasiment aussi performant que les meilleurs modèles fermés, mais nettement moins cher à faire tourner en production, en particulier pour des tâches longues et complexes nécessitant des outils.
Techniquement, la publication a mis en lumière une architecture à 256 experts routés dont 6 actifs par token, avec trois niveaux d'effort de raisonnement configurables et un module de décodage spéculatif baptisé DSpark activable en un seul paramètre. Plusieurs commentateurs insistent sur le fait que ce bond de performance provient uniquement de l'amélioration du post-entraînement, pas d'un changement d'échelle ou de pré-entraînement, ce qui suggère que la marge de progression via un meilleur ajustement pour l'usage d'outils et les tâches longues reste importante. Des praticiens ont également noté que les modèles ouverts tirent de plus en plus parti de harnais plus légers et de déploiements optimisés pour le cache, plutôt que d'une orchestration lourde, une tendance qui pourrait redéfinir la manière dont les agents IA sont construits et exploités à l'avenir.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



