Aller au contenu principal
LLMs · Actu ·

Meta AI lance Muse Glimmer, un modèle open source de 30 milliards de paramètres exécutable sur un seul GPU grand public

Meta a mis en ligne Muse Glimmer, un modèle multimodal de 30 milliards de paramètres distillé à partir de Muse Spark et publié sous licence ouverte Apache 2.0. Techniquement, il s'agit d'un transformeur causal dense associé à un encodeur de perception dédié d'environ 1,8 milliard de paramètres (ViT-G/14), capable de traiter jusqu'à 4 096 tokens visuels par image. L'attention repose sur un mécanisme de type "grouped-query" avec 32 têtes de requête et 2 têtes clé-valeur, une fenêtre glissante de 2 048 tokens et un encodage RoPE. Le modèle affiche une fenêtre de contexte supérieure à 131 000 tokens, un vocabulaire de 202 048 tokens, et une date de connaissance arrêtée au 4 janvier 2026. L'entraînement s'est déroulé en trois phases : pré-entraînement par distillation des logits de Muse Spark, entraînement intermédiaire enrichi en données agentiques longues, puis post-entraînement combinant apprentissage supervisé et renforcement sur le raisonnement, le code et les tâches d'agent. La collection Hugging Face associée propose des poids BF16, des versions quantifiées GGUF et des builds ExecuTorch.

2 min de lecturePertinence 50

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Également couvert par VentureBeat AI.

L'enjeu principal tient à la compression : alors qu'un modèle de cette taille nécessite habituellement plus de 55 Go de mémoire en pleine précision, Meta le ramène à environ 4 bits, faisant passer le modèle de langage sous les 20 Go, ce qui le rend exploitable sur un seul GPU grand public de 24 ou 32 Go, voire sur un Mac, sans appel réseau. Deux versions quantifiées sont proposées, l'une ciblant 32 Go de VRAM avec une dégradation moyenne de 0,2 %, l'autre 24 Go avec 1 % de perte. Un mécanisme de décodage spéculatif nommé DFlash, qui prédit des blocs de 16 tokens par passe, triple quasiment la vitesse de génération : sur une RTX 5090, le débit passe de 74,9 à 233,4 tokens par seconde. Cette capacité à tourner localement, sans facturation au token et potentiellement en environnement isolé du réseau, ouvre la voie à des déploiements dans la santé, le secteur juridique, la finance, la défense ou l'industrie, là où la résidence des données ou la latence excluent le recours au cloud.

Sur les benchmarks, Muse Glimmer devance Gemma4-31B et Qwen3.6-27B sur l'orchestration agentique et le raisonnement, avec par exemple 75,5 sur MCP Atlas contre 54,2 et 62,5, ou 94,7 sur AIME 2026. Il reste en revanche derrière Qwen3.6-27B sur des tâches d'usage d'ordinateur comme OSWorld-Verified ou le codage via terminal. Côté sécurité, le taux de réussite d'attaques mesuré sur Siren AgentDojo s'établit à 28,4 % pour une utilité de 94 %, ce qui pousse Meta à recommander l'ajout de garde-fous applicatifs plutôt qu'un déploiement du modèle en accès direct.

Impact France / UEChamp produit par Le Fil IA

La possibilité de déploiement local sans appel réseau intéressé les secteurs européens soumis a des exigences de résidence des données comme la sante, la finance ou la défense.

Notre lecture

Le move ici c'est la compression, pas la taille. Trente milliards de paramètres écrasés à 4 bits, ça tient sous les 20 Go de VRAM, donc sur une seule carte grand public ou un Mac, sans appel réseau, ce qui ouvre enfin la porte à la santé, la finance ou la défense, là où les données ne sortent pas du site. Sur le papier ça a l'air propre, mais Meta recommande lui-même de ne pas le laisser en accès direct : 28% d'attaques qui passent quand même, donc faut des garde-fous autour, pas juste télécharger et lancer.

À lire ensuite

01Meta ouvre en open source Muse Glimmer, un modèle à base d'agents de 30 milliards de paramètres optimisé pour l'exécution locale48InfoQ AILLMs 02NVIDIA lance Nemotron 3 Ultra, un modèle open source de 550 milliards de paramètres50Latent SpaceLLMs 03Meta lance Muse Glimmer, des agents IA locaux pour GPU grand public47AI NewsLLMs 
Dossier · Meta IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.