DeepSeek améliore DeepSeek-V4-Flash-0731 avec de gros progrès en codage et en agents autonomes
DeepSeek a publié le 31 juillet 2026 la version DeepSeek-V4-Flash-0731 sur Hugging Face, tout en faisant passer l'API officielle V4-Flash en bêta publique. La fiche du modèle précise qu'il s'agit de la version officielle qui remplace la préversion, avec une architecture et une taille inchangées : les progrès viennent d'un réentraînement post-training, pas d'une nouvelle conception. Le point de contrôle intègre le module de décodage spéculatif DSpark, comme la variante DeepSeek-V4-Flash-DSpark. Hugging Face indique 304 milliards de paramètres pour le dépôt, ce chiffre incluant ce module de brouillon ajouté à la base de 284 milliards de paramètres. Côté API, deepseek-v4-flash prend désormais nativement en charge le format Responses API et a été adapté pour Codex. En revanche, l'API V4-Pro ainsi que les modèles de l'application et du site web n'ont pas été mis à jour.
Sur le plan tarifaire, DeepSeek affiche 0,14 dollar par million de tokens en entrée en cas d'échec de cache, 0,0028 dollar en cas de succès de cache, et 0,28 dollar par million de tokens en sortie, avec une limite de concurrence fixée à 2 500 requêtes simultanées. C'est environ un tiers du tarif de sortie de deepseek-v4-pro, fixé à 0,87 dollar. Ce niveau de prix ouvre l'exécution de boucles d'agents à des startups en amorçage, des développeurs indépendants et des équipes de plateforme interne sans budget GPU dédié. L'auto-hébergement reste en revanche réservé aux acteurs disposant d'une infrastructure conséquente : les poids sont publiés sous licence MIT sans verrou d'accès, mais chaque expert du mélange reste chargé en mémoire même si seuls 13 milliards de paramètres s'activent par token. L'exemple vLLM de DeepSeek fait tourner le modèle sur un unique nœud à quatre GPU GB300, et les versions GGUF dynamiques d'Unsloth demandent environ 162 Go en 8 bits sans perte ou 103 Go en 3 bits, pour un total d'environ 110 Go de mémoire vive et vidéo combinées.
Sur les benchmarks internes publiés par DeepSeek, les gains sont nets face à la préversion : le score Terminal Bench 2.1 passe de 61,8 à 82,7, NL2Repo de 39,4 à 54,2, et Cybergym de 38,7 à 76,7, dépassant même V4-Pro Preview et GLM-5.2 sur plusieurs tests, tout en restant en retrait face à Opus-4.8. Le modèle repose sur une architecture MoE de 284 milliards de paramètres avec 13 milliards activés par token et une fenêtre de contexte d'un million de tokens, combinant attention compressée et hyper-connexions à contrainte de variété, entraînée sur plus de 32 000 milliards de tokens avec l'optimiseur Muon. DeepSeek précise que ces scores d'agents dépendent d'un harnais de test en mode minimal, non encore rendu public, ce qui laisse une marge d'incertitude pour des évaluations menées de façon indépendante.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



