Le Fil IA déploie Kimi K3 sur Amazon SageMaker HyperPod et Amazon EKS
Moonshot AI a dévoilé le 27 juillet 2026 Kimi K3, un modèle de langage à mélange d'experts (Mixture of Experts) de 2,8 billions de paramètres, devenant ainsi le premier système à poids ouverts à franchir la barre des 3 000 milliards de paramètres. L'architecture répartit ces paramètres sur 896 experts spécialisés, dont seulement 16 sont activés par token, ce qui limite à environ 104 milliards le nombre de paramètres réellement mobilisés à chaque inférence, un gain d'efficacité de 2,5 fois par rapport à son prédécesseur Kimi K2. Le modèle repose sur des innovations techniques telles que le Kimi Delta Attention, le Gated Multi Head Latent Attention et un cadre appelé Stable LatentMoE, et affiche une fenêtre de contexte d'un million de tokens ainsi qu'une prise en charge multimodale native texte et image. Ses poids sont publiés sur Hugging Face sous l'identifiant moonshotai/Kimi-K3, au format MXFP4 (Microscaling Floating Point 4 bits), pensé pour équilibrer qualité et efficacité mémoire lors du déploiement à grande échelle.
Cette annonce marque une étape significative pour l'écosystème des modèles ouverts : les organisations peuvent désormais héberger elles-mêmes l'un des systèmes d'IA les plus capables au monde, sans dépendre d'un fournisseur propriétaire. Kimi K3 cible en priorité les tâches complexes que sont le codage sur de longs horizons, les flux de travail agentiques multi-étapes et le raisonnement avancé, avec un mode de réflexion permanent et un support natif des appels d'outils et des sorties structurées. Mais cette puissance a un coût matériel considérable : servir un tel modèle exige une infrastructure GPU haut de gamme, en l'occurrence des instances p6-b300 embarquant huit GPU NVIDIA B300 Blackwell Ultra, seules capables de gérer l'inférence en parallélisme tensoriel sur l'ensemble du pool d'experts.
Amazon Web Services propose deux voies pour déployer Kimi K3 sur son infrastructure : Amazon SageMaker HyperPod, via son opérateur d'inférence installé automatiquement à la création du cluster, qui simplifie l'orchestration des conteneurs et la gestion des points de terminaison, et Amazon Elastic Kubernetes Service (EKS). Pour la capacité de calcul, AWS met à disposition des plans de formation flexibles réservant des ressources GPU pour HyperPod, ainsi que des Capacity Blocks permettant de réserver des instances p6-b300 pour une durée définie sans engagement à long terme. Le service repose sur un conteneur d'inférence vLLM dédié à Kimi K3, encore distribué séparément sous vllm/vllm-openai:kimi-k3 en attendant son intégration au conteneur principal, vLLM offrant un support natif des architectures MoE, du parallélisme tensoriel et de la quantification MXFP4.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



