Aller au contenu principal
Infrastructure · Actu ·

Déploiement de Kimi K3 sur Amazon SageMaker HyperPod et Amazon EKS

Moonshot AI a dévoilé le 27 juillet 2026 Kimi K3, un modèle de langage à mélange d'experts (Mixture of Experts) de 2,8 billions de paramètres, devenant ainsi le premier système à poids ouverts à franchir la barre des 3 000 milliards de paramètres. L'architecture répartit ces paramètres sur 896 experts spécialisés, dont seulement 16 sont activés par token, ce qui limite à environ 104 milliards le nombre de paramètres réellement mobilisés à chaque inférence, un gain d'efficacité de 2,5 fois par rapport à son prédécesseur Kimi K2. Le modèle repose sur des innovations techniques telles que le Kimi Delta Attention, le Gated Multi Head Latent Attention et un cadre appelé Stable LatentMoE, et affiche une fenêtre de contexte d'un million de tokens ainsi qu'une prise en charge multimodale native texte et image. Ses poids sont publiés sur Hugging Face sous l'identifiant moonshotai/Kimi-K3, au format MXFP4 (Microscaling Floating Point 4 bits), pensé pour équilibrer qualité et efficacité mémoire lors du déploiement à grande échelle.

2 min de lecturePertinence 44
Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette annonce marque une étape significative pour l'écosystème des modèles ouverts : les organisations peuvent désormais héberger elles-mêmes l'un des systèmes d'IA les plus capables au monde, sans dépendre d'un fournisseur propriétaire. Kimi K3 cible en priorité les tâches complexes que sont le codage sur de longs horizons, les flux de travail agentiques multi-étapes et le raisonnement avancé, avec un mode de réflexion permanent et un support natif des appels d'outils et des sorties structurées. Mais cette puissance a un coût matériel considérable : servir un tel modèle exige une infrastructure GPU haut de gamme, en l'occurrence des instances p6-b300 embarquant huit GPU NVIDIA B300 Blackwell Ultra, seules capables de gérer l'inférence en parallélisme tensoriel sur l'ensemble du pool d'experts.

Amazon Web Services propose deux voies pour déployer Kimi K3 sur son infrastructure : Amazon SageMaker HyperPod, via son opérateur d'inférence installé automatiquement à la création du cluster, qui simplifie l'orchestration des conteneurs et la gestion des points de terminaison, et Amazon Elastic Kubernetes Service (EKS). Pour la capacité de calcul, AWS met à disposition des plans de formation flexibles réservant des ressources GPU pour HyperPod, ainsi que des Capacity Blocks permettant de réserver des instances p6-b300 pour une durée définie sans engagement à long terme. Le service repose sur un conteneur d'inférence vLLM dédié à Kimi K3, encore distribué séparément sous vllm/vllm-openai:kimi-k3 en attendant son intégration au conteneur principal, vLLM offrant un support natif des architectures MoE, du parallélisme tensoriel et de la quantification MXFP4.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Cache hiérarchique KV pour LLM sur Amazon SageMaker HyperPod avec Curvine42AWS ML BlogInfrastructure 02Amazon déploie une infrastructure d'apprentissage par renforcement multi-tours pour Nova sur SageMaker HyperPod34AWS ML BlogInfrastructure 03Bonnes pratiques pour l'inférence sur Amazon SageMaker HyperPod38AWS ML BlogInfrastructure 
Dossier · Moonshot AISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.