Kimi K3 déployé sur AWS
Moonshot AI a publié le 27 juillet 2026 Kimi K3, un modèle de langage à mélange d'experts (Mixture of Experts) doté de 2,8 billions de paramètres, devenant ainsi le premier système à poids ouverts à franchir le seuil des 3 000 milliards de paramètres. Son architecture repose sur trois innovations techniques : l'attention Kimi Delta (KDA), une attention latente multi têtes à portes (Gated MLA) et un cadre appelé Stable LatentMoE. Le modèle répartit ses paramètres sur 896 experts spécialisés, dont seulement 16 sont activés à chaque token traité, ce qui ramène le nombre de paramètres réellement actifs à environ 104 milliards par passage. Moonshot AI annonce un gain d'efficacité de 2,5 fois par rapport à son prédécesseur, Kimi K2. Le modèle dispose d'une fenêtre de contexte d'un million de tokens, gère nativement le texte et l'image, et intègre l'appel d'outils, la génération de sorties structurées et un mode de raisonnement permanent pour les tâches complexes. Les poids sont disponibles sur Hugging Face sous l'identifiant moonshotai/Kimi-K3, au format MXFP4 (virgule flottante 4 bits à micro échelle), choisi pour son équilibre entre qualité et efficacité mémoire.
Cette publication marque une étape importante pour les entreprises souhaitant héberger elles-mêmes un modèle de niveau frontière plutôt que de dépendre d'une API propriétaire. Mais la contrepartie de cette ouverture est une exigence matérielle considérable : Amazon Web Services, qui a documenté deux méthodes de déploiement, précise que Kimi K3 nécessite une instance p6-b300 équipée de huit GPU NVIDIA B300 Blackwell Ultra reliés par une interconnexion à très haut débit, indispensable pour répartir efficacement le calcul entre les centaines d'experts du modèle. Cette exigence illustre une tension croissante dans l'écosystème de l'IA ouverte : les modèles les plus capables deviennent aussi les plus coûteux à faire fonctionner, réservant de fait leur usage à des organisations disposant d'infrastructures GPU de pointe.
Pour répondre à cette demande, AWS propose désormais deux voies de déploiement, via Amazon SageMaker HyperPod avec son opérateur d'inférence, qui simplifie l'orchestration et la gestion des points de terminaison, ou via un cluster Amazon EKS. Dans les deux cas, le service d'inférence recommandé est vLLM, dont une version spécifique à Kimi K3 doit encore être fusionnée dans la branche principale. Pour garantir l'accès à cette capacité GPU rare, AWS met en avant ses Flexible Training Plans et ses Capacity Blocks, deux mécanismes de réservation conçus pour sécuriser l'accès aux instances p6-b300. Cette course entre laboratoires d'IA et fournisseurs cloud pour rendre exploitables des modèles toujours plus massifs devrait s'intensifier à mesure que d'autres acteurs, comme DeepSeek ou Meta, cherchent eux aussi à repousser les limites des modèles à poids ouverts.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




