Aller au contenu principal
Zyphra lance ZAYA1-8B : un modèle de raisonnement MoE entraîné sur matériel AMD aux performances bien supérieures à sa taille
LLMsMarkTechPost · 2 min de lecture

Zyphra lance ZAYA1-8B : un modèle de raisonnement MoE entraîné sur matériel AMD aux performances bien supérieures à sa taille

Source originale ↗·

Zyphra AI a publié ZAYA1-8B, un petit modèle de langage de type Mixture of Experts (MoE) comptant 760 millions de paramètres actifs pour 8,4 milliards de paramètres au total. Entraîné intégralement sur des processeurs AMD, un cluster de 1 024 cartes AMD Instinct MI300x interconnectées via AMD Pensando Pollara, construit en partenariat avec IBM, le modèle est désormais disponible sous licence Apache 2.0 sur Hugging Face et en endpoint serverless sur Zyphra Cloud. Malgré sa taille modeste, ZAYA1-8B affiche des performances compétitives avec des modèles bien plus grands sur les benchmarks de mathématiques et de code : il surpasse Claude 4.5 Sonnet et GPT-5-High sur le HMMT'25, une compétition de mathématiques avancées (89,6 points contre 88,3), et se rapproche des meilleurs modèles open-weight comme DeepSeek-V3.2. Cette efficacité repose sur une méthode inédite de calcul à l'inférence baptisée Markovian RSA, ainsi que sur une architecture MoE++ combinant trois innovations techniques : une attention convolutive compressée réduisant le KV-cache d'un facteur 8, un routeur basé sur un réseau de neurones MLP avec équilibrage de charge par contrôleur PID, et un mécanisme de mise à l'échelle résiduelle apprise pour stabiliser l'entraînement en profondeur.

La distinction entre paramètres actifs et paramètres totaux est au coeur de l'intérêt du modèle. Dans un modèle classique, tous les paramètres s'activent à chaque token traité ; dans un MoE, seule une fraction des experts est sollicitée à chaque inférence. Avec seulement 760 millions de paramètres actifs par passe, ZAYA1-8B peut tourner en local sur des appareils grand public, s'intégrer dans des pipelines à calcul augmenté et servir des requêtes avec une latence réduite, tout en maintenant des performances proches de modèles dix fois plus grands. Pour les développeurs et entreprises qui cherchent à déployer des capacités de raisonnement avancées sans infrastructure lourde, ce rapport coût-performance représente une avancée concrète.

ZAYA1-8B s'inscrit dans une tendance de fond qui voit plusieurs laboratoires challenger, DeepSeek en tête depuis début 2025, démontrer que l'architecture et la méthode d'entraînement comptent autant que la taille brute des modèles. Zyphra, encore peu connu du grand public, affirme avoir bâti un pipeline d'entraînement en cinq étapes post-préentraînement, intégrant notamment un échauffement au raisonnement, du reinforcement learning en cascade, et des étapes spécifiques de calcul augmenté à l'inférence. L'entraînement entièrement réalisé sur AMD est également un signal politique : dans un secteur dominé par Nvidia, valider une chaîne de production complète sur hardware concurrent ouvre la voie à une diversification des infrastructures IA. Les prochains modèles de Zyphra, selon ses propres communications, viseront des tailles supérieures avec la même philosophie d'efficacité par paramètre.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

ZAYA1-8B : modèle de raisonnement open source très efficace, entraîné sur GPU AMD Instinct MI300
1VentureBeat AI 

ZAYA1-8B : modèle de raisonnement open source très efficace, entraîné sur GPU AMD Instinct MI300

La startup californienne Zyphra, basée à Palo Alto, a publié cette semaine ZAYA1-8B, un modèle de langage de raisonnement à architecture mixture-of-experts (MoE) comptant un peu plus de 8 milliards de paramètres, dont seulement 760 millions sont actifs simultanément. Disponible gratuitement sur Hugging Face sous licence Apache 2.0, le modèle peut être téléchargé, modifié et déployé immédiatement par les entreprises comme par les développeurs indépendants. Malgré sa taille modeste, ZAYA1-8B affiche des performances compétitives face à GPT-5-High d'OpenAI et DeepSeek-V3.2 sur plusieurs benchmarks tiers. Mais ce qui attire surtout l'attention, c'est la plateforme matérielle utilisée pour l'entraîner : des GPU AMD Instinct MI300, les puces concurrentes de Nvidia lancées il y a près de trois ans, sur lesquelles Zyphra a fait tourner l'intégralité de son pipeline d'entraînement. Ce modèle illustre une tendance de fond dans le secteur : pendant qu'OpenAI et Anthropic s'affrontent sur des modèles toujours plus massifs, une nouvelle génération de laboratoires mise sur la densité d'intelligence plutôt que sur la taille brute. Avec 760 millions de paramètres actifs seulement, ZAYA1-8B peut tourner sur du matériel bien moins coûteux, ouvrant la porte à des déploiements locaux ou embarqués inaccessibles aux géants du secteur. Sur le plan matériel, la réussite de l'entraînement sur AMD MI300 est un signal fort : elle démontre concrètement qu'il existe une alternative viable aux GPU Nvidia, qui dominent jusqu'ici quasi exclusivement l'écosystème d'entraînement de modèles IA. L'architecture MoE++ propriétaire de Zyphra repose sur trois innovations techniques. La première, l'attention convolutive compressée (CCA), réduit de huit fois la taille du cache KV par rapport à l'attention multi-têtes classique, ce qui améliore l'efficacité sur les contextes longs. La deuxième remplace le routeur linéaire standard des modèles MoE par un réseau de neurones multi-couches plus expressif, stabilisé par un mécanisme de rééquilibrage inspiré des contrôleurs PID de l'automatique industrielle. La troisième, le Learned Residual Scaling, contrôle la croissance des normes résiduelles sur les 40 couches du modèle pour éviter les problèmes de gradient. En amont de l'entraînement, Zyphra a intégré le raisonnement dès la phase de préentraînement, en développant une technique baptisée AP Trimming qui compresse les longues chaînes de pensée en supprimant leur partie médiane tout en préservant le problème et la solution finale. À l'inférence, la méthode Markovian RSA permet d'améliorer la qualité des réponses sans simplement allonger la chaîne de raisonnement, une approche qui constitue selon Zyphra la principale source de gain de performance du modèle.

UELe modèle étant publié sous Apache 2.0 sur Hugging Face, les développeurs et entreprises européens peuvent le télécharger et le déployer immédiatement pour des cas d'usage locaux à faible coût matériel.

LLMsOpinion
1 source
Thinking Machines lance Inkling Small, un modèle open source proche des performances de son prédécesseur pour environ un quart de sa taille
2VentureBeat AI 

Thinking Machines lance Inkling Small, un modèle open source proche des performances de son prédécesseur pour environ un quart de sa taille

La startup Thinking Machines, dirigée par l'ancienne directrice technique d'OpenAI Mira Murati, a dévoilé Inkling-Small, un nouveau modèle d'intelligence artificielle open source, seulement deux semaines après le lancement de son premier modèle, Inkling. Inkling-Small compte 276 milliards de paramètres, contre 975 milliards pour son prédécesseur, mais n'utilise que 12 milliards de paramètres actifs par token, contre 41 milliards pour Inkling. Distribué sous licence permissive Apache 2.0, ce modèle multimodal accepte du texte, des images et de l'audio en entrée, produit du texte en sortie, et gère une fenêtre de contexte allant jusqu'à un million de tokens. Sur l'index d'intelligence de référence publié par Artificial Analysis, il obtient un score de 40, contre 41 pour Inkling, un écart minime qui en fait, selon l'organisme, le modèle open source le plus performant à cette taille ou en dessous. Les poids complets sont disponibles sur Hugging Face, avec un support pour le fine-tuning via l'API Tinker de l'entreprise, et un tarif de lancement réduit de 50%, soit 0,58 dollar par million de tokens en entrée, 1,44 dollar par million de tokens générés et 1,73 dollar par million de tokens d'entraînement pour la version standard à 64000 tokens de contexte. Pour les entreprises, l'intérêt ne réside pas seulement dans la taille réduite du modèle, mais dans le fait qu'il conserve l'essentiel des capacités de son grand frère tout en réduisant nettement les besoins en calcul, les coûts d'inférence et l'empreinte de déploiement. Inkling-Small dépasse même Inkling sur plusieurs benchmarks techniques, avec 80,2% contre 77,6% sur SWE-bench Verified et 64,7% contre 63,8% sur Terminal Bench 2.1, ce qui en fait un candidat solide pour les assistants de codage, les systèmes d'outils automatisés ou l'analyse documentaire. Cette avancée reste toutefois inégale: sur les tâches nécessitant des connaissances factuelles ou certains usages agentiques, comme le benchmark bancaire τ³-Banking où il chute à 15,5% contre 23,7% pour Inkling, le modèle marque un net recul, ce qui impose aux entreprises de maintenir des mécanismes de vérification et de relecture humaine pour les usages à fort enjeu. Sur le plan technique, Inkling-Small repose sur une architecture de type mélange d'experts, avec un décodeur à 42 couches qui redirige chaque token vers six experts spécialisés parmi un ensemble de 256, complétés par deux experts partagés qui restent actifs en permanence. Cette conception explique l'écart entre ses 276 milliards de paramètres totaux et ses 12 milliards de paramètres réellement mobilisés à chaque calcul. Elle illustre une tendance plus large du secteur de l'IA générative, où les laboratoires cherchent désormais à comprimer les performances des grands modèles dans des architectures plus légères et moins coûteuses à exploiter, sans sacrifier la compétitivité face aux modèles propriétaires fermés.

💬 Bon, sur le papier c'est exactement le genre de compression qu'on attendait : un quart de la taille, un tiers des paramètres actifs, et l'essentiel des perfs qui suit, voire dépasse le modèle d'origine sur le code (SWE-bench, Terminal Bench). Mais la chute sur τ³-Banking (15,5% contre 23,7%) dit un truc important qui dépasse Thinking Machines : compresser un modèle, ça ne rétrécit pas uniformément ses capacités, ça les découpe de façon inégale, et personne ne sait encore prédire quelles compétences sautent en premier. Pour une boîte qui veut déployer ça en prod sur des tâches à enjeu, ça reste un pari, pas un remplacement automatique.

LLMsActu
1 source
Meta Superintelligence Labs lance Muse Spark 1.1, un modèle de raisonnement multimodal pour les tâches à base d'agents sur Meta Model API
3MarkTechPost 

Meta Superintelligence Labs lance Muse Spark 1.1, un modèle de raisonnement multimodal pour les tâches à base d'agents sur Meta Model API

Meta Superintelligence Labs a dévoilé Muse Spark 1.1, un modèle de raisonnement multimodal conçu pour les tâches agentiques, et a ouvert en parallèle un aperçu public de la Meta Model API. Ce second élément marque un tournant structurel : jusqu'ici, les modèles de Meta étaient distribués principalement en poids ouverts, alors que Muse Spark 1.1 est fermé, hébergé et facturé au token. Le modèle dispose d'une fenêtre de contexte d'un million de tokens (1 048 576 selon la documentation technique de l'API) et accepte du texte, des images, de la vidéo et des documents en entrée, avec une sortie textuelle. Son effort de raisonnement est ajustable à chaque requête, et l'API propose en complément la sortie structurée, l'appel d'outils en parallèle, une Files API, la mise en cache des prompts et un outil de recherche web renvoyant des réponses sourcées. Côté accès, les particuliers profitent du mode "Thinking" gratuitement dans l'application Meta AI et sur meta.ai, tandis que les développeurs paient 1,25 dollar par million de tokens en entrée et 4,25 dollars par million en sortie, avec 20 dollars de crédits offerts à la création d'un compte. Le lancement reste pour l'instant réservé aux États-Unis, sans disponibilité en Europe. Sur le plan des performances, Meta positionne clairement Muse Spark 1.1 comme un modèle d'orchestration plutôt qu'un champion du code. Il domine les benchmarks liés à l'usage d'outils : 88,1 sur MCP Atlas contre 82,2 pour Opus 4.8, 75,3 pour GPT-5.5 et 78,2 pour Gemini 3.1 Pro, et 54,7 sur JobBench contre 48,4, 38,3 et seulement 15,9 pour Gemini. Il obtient aussi le meilleur score sur Humanity's Last Exam (62,1). En revanche, sur le code pur, il se classe troisième, avec 61,5 sur SWE-Bench Pro et 53,3 sur DeepSWE 1.1, loin derrière Gemini 3.1 Pro sur ce dernier test (67,0). Ce qui distingue vraiment le modèle, c'est sa gestion active de son contexte massif : il mémorise ses actions, retrouve des informations issues de travaux antérieurs et compacte ce qu'il conserve. Il peut aussi déléguer des tâches à des sous-agents en parallèle lorsqu'il agit comme agent principal, et exécuter fidèlement une mission tout en sachant remonter un problème lorsqu'il agit comme sous-agent, avec une capacité de généralisation immédiate à de nouveaux outils, serveurs MCP ou compétences personnalisées. Cette sortie s'inscrit dans une bataille plus large entre grands laboratoires d'IA pour dominer les usages agentiques, où la capacité à orchestrer des outils et des sous-tâches complexes compte désormais autant que la performance brute sur le code. En rendant son API compatible avec le format OpenAI, Meta facilite l'intégration : migrer vers Muse Spark 1.1 revient essentiellement à changer une URL de base plutôt qu'à réécrire une application, et les environnements compatibles avec le format Anthropic peuvent pointer vers l'équivalent Messages API. Pour l'automatisation d'ordinateur, le modèle a été entraîné à choisir entre écrire un script ou cliquer directement selon ce qui est le plus efficace, générant des lots d'actions à chaque étape. L'absence d'accès européen et le choix par Meta de son propre jeu de benchmarks invitent toutefois à la prudence avant d'en tirer des conclusions définitives sur sa supériorité réelle face aux modèles concurrents.

💬 Muse Spark 1.1 n'essaie pas de battre GPT-5.5 ou Gemini sur le code, il joue une autre partie : celle de chef d'orchestre qui délègue à des sous-agents et gère un million de tokens de contexte sans perdre le fil. C'est révélateur d'un vrai basculement dans la course à l'IA, la bataille se déplace du "qui code le mieux" vers "qui orchestre le mieux", et les scores sur MCP Atlas ou JobBench comptent maintenant autant que SWE-Bench. Reste que c'est fermé, payant, réservé aux US, et benchmarké par Meta lui-même, donc j'attends de voir ça tourner ailleurs qu'en démo avant de crier au génie.

LLMsActu
1 source
Xiaomi lance MiMo-V2.5-Pro et MiMo-V2.5 : des performances comparables aux grands modèles pour un coût en tokens bien inférieur
4MarkTechPost 

Xiaomi lance MiMo-V2.5-Pro et MiMo-V2.5 : des performances comparables aux grands modèles pour un coût en tokens bien inférieur

L'équipe MiMo de Xiaomi vient de publier deux nouveaux modèles d'intelligence artificielle, MiMo-V2.5-Pro et MiMo-V2.5, disponibles immédiatement via API à des tarifs compétitifs. Le modèle phare, MiMo-V2.5-Pro, affiche des scores de référence qui le placent aux côtés des meilleurs systèmes propriétaires actuels : 57,2 sur SWE-bench Pro, 63,8 sur Claw-Eval et 72,9 sur τ3-Bench, des résultats comparables à ceux de Claude Opus 4.6 et GPT-5.4. Pour illustrer ses capacités en conditions réelles, Xiaomi a publié trois démonstrations exigeantes : la génération d'un compilateur complet en Rust depuis zéro, inspiré d'un projet du cours de compilation de l'Université de Pékin, réalisée en 4,3 heures et 672 appels d'outils avec un score parfait de 233 sur 233 sur la suite de tests officielle ; la création d'un éditeur vidéo de bureau fonctionnel comptant 8 192 lignes de code, produit en 11,5 heures et 1 868 appels d'outils ; et une tâche de conception de circuit analogique de niveau master en EDA portant sur un régulateur LDO à suiveur de tension inversé. Ce qui distingue MiMo-V2.5-Pro des modèles classiques, c'est sa capacité à opérer de manière autonome sur des tâches longues et complexes impliquant plus d'un millier d'appels d'outils successifs. Là où la plupart des grands modèles de langage répondent à des questions isolées, les modèles dits agentiques doivent maintenir un objectif sur de nombreuses étapes, utiliser des outils comme la recherche web, l'exécution de code ou les appels d'API, et corriger leurs propres erreurs en chemin. La démonstration du compilateur Rust est particulièrement frappante : plutôt que de procéder par tâtonnements, le modèle a construit le compilateur couche par couche, atteignant dès la première compilation 137 tests réussis sur 233, soit 59% du score final avant même d'avoir lancé un seul test unitaire ciblé. Lorsque des régressions sont apparues à la suite d'un refactoring, le modèle les a diagnostiquées et corrigées de manière autonome. Xiaomi nomme cette propriété la "harness awareness" : le modèle ne suit pas les instructions mécaniquement, il optimise activement son propre environnement de travail pour rester sur la trajectoire correcte sur de très longues séquences. Ces performances s'inscrivent dans une course serrée entre modèles ouverts et systèmes propriétaires, une dynamique qui s'accélère depuis 2025. Pendant des années, les capacités agentiques les plus avancées restaient l'apanage exclusif des grands laboratoires fermés comme OpenAI, Anthropic ou Google DeepMind. L'irruption de modèles ouverts ou semi-ouverts aux performances comparables, portée par des acteurs comme Xiaomi, Meta ou DeepSeek, redistribue les cartes du secteur. Pour les développeurs et les entreprises, l'accès à des capacités de niveau frontier via des API compétitives change le calcul économique : des tâches qui nécessitaient jusqu'ici des appels coûteux à des systèmes propriétaires deviennent accessibles à moindre coût. Si MiMo-V2.5-Pro tient ses promesses en production, il pourrait accélérer significativement l'adoption de l'IA agentique dans l'ingénierie logicielle, l'automatisation industrielle et la recherche scientifique.

UELes développeurs et entreprises européens peuvent accéder à des capacités agentiques de niveau frontier via une API compétitive, réduisant le coût d'adoption de l'IA agentique dans l'ingénierie logicielle et l'automatisation industrielle.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic