Xiaomi MiMo-V2.6-Pro 1T-A42B, entraîné pour 3 millions de dollars, devient le meilleur modèle en poids ouverts
Xiaomi a dévoilé cette semaine MiMo-V2.6, une nouvelle famille de modèles d'intelligence artificielle en poids ouverts qui se hisse au sommet des classements pour cette catégorie. La gamme comprend deux versions nativement omnimodales : MiMo-V2.6-Pro, présenté comme le modèle le plus capable jamais produit par l'entreprise, et MiMo-V2.6-Flash, conçu pour équilibrer intelligence, efficacité et coût. Une variante, MiMo-V2.6-Pro-UltraSpeed, promet jusqu'à 20 fois plus de vitesse de génération à qualité égale. Selon le rapport technique publié par Xiaomi, le modèle principal repose sur une architecture MoE d'environ 1 000 milliards de paramètres avec 42 milliards de paramètres actifs, entraînée pour un coût annoncé de 3 millions de dollars. L'entraînement par renforcement a été démultiplié selon trois axes : des lots plus larges (1 568 échantillons par mise à jour, jusqu'à 1 million de tokens de contexte, 3,5 à 3,7 milliards de tokens traités par étape) sur une architecture entièrement asynchrone, un éventail élargi de tâches couvrant le code, les agents généralistes, le visuel et la cybersécurité, et davantage de calcul consacré à l'évaluation des réponses. Fuli Luo, ancienne ingénieure vedette de DeepSeek désormais chez Xiaomi, a publié en direct les métriques des dernières phases d'entraînement, un niveau de transparence inhabituel dans ce secteur.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →
Cette sortie illustre le déplacement de la compétition sur les poids ouverts vers l'avant-garde technologique, et non plus seulement vers les modèles de taille intermédiaire. Xiaomi, connu avant tout comme fabricant de smartphones et absent de la liste habituelle des six grands laboratoires chinois d'IA, s'impose ainsi comme un acteur frontière à part entière, ce qui bouscule la hiérarchie établie. L'entreprise ouvre le code des environnements d'entraînement pour le développement logiciel, la reproduction de vulnérabilités, le travail agentique, le développement web et la génération musicale, même si les jeux de données complets de plus de 7 000 tâches restent pour l'instant non publiés. Pour les entreprises, cela signifie davantage d'options pour construire des modèles personnalisés à partir de poids ouverts, réduisant la dépendance à des fournisseurs d'API comme OpenAI ou Anthropic et abaissant les coûts.
Ce lancement s'inscrit dans une cadence de publications particulièrement dense côté chinois : Kimi K3, Qwen3.8-Max, DeepSeek V4-Pro, GLM-5.3, Hy4 Preview et Atria Dawn sont tous sortis en l'espace de dix semaines. Ce rythme alimente un débat entre observateurs du secteur : certains, comme le chercheur Yuchenj_UW, estiment que les capacités de codage des modèles frontière stagnent depuis Opus 4.8 tandis que les modèles ouverts referment l'écart à un coût 10 à 50 fois inférieur, tandis que d'autres, comme teortaxesTex, jugent que l'avant-garde s'est au contraire scindée en nouveaux paliers où les modèles fermés internes gardent une avance nette. Le sujet dépasse la sphère technique : le chercheur Nathan Lambert a partagé un briefing présenté au Congrès américain sur les performances des modèles ouverts et l'état de la concurrence entre États-Unis et Chine dans ce domaine.
Les entreprises européennes disposent d'une option supplémentaire de modèle en poids ouverts pour réduire leur dépendance aux fournisseurs d'API existants et diminuer leurs couts d'IA.