Aller au contenu principal
Création · Actu ·

MiniMax lance MiniMax-Music3, un modèle musical en poids ouverts générant des morceaux complets de cinq minutes

Le 13 août 2026, la société chinoise MiniMax a publié MiniMax-Music3, un modèle texte-vers-musique à poids ouverts. Il prend en entrée des paroles balisées par section (couplet, refrain, pont) et une description musicale détaillée, la "Structured Caption", précisant métadonnées, voix et arrangement. En une seule génération, il produit un morceau complet de jusqu'à cinq minutes, au format WAV stéréo 16 bits/32 kHz. Son architecture associe un "Hybrid-LM", un modèle de 8 milliards de paramètres pour la structure générale et un second de 0,6 milliard pour le détail au sein de chaque frame, à un module de flow matching de 2,4 milliards de paramètres et un Flow-VAE de 123 millions de paramètres hérité de MiniMax Speech. MiniMax a publié le même jour les poids, le code d'inférence et trois méthodes de déploiement : un serveur SGLang-Omni nécessitant deux GPU, un pipeline diffusers fonctionnant dès 8 Go de VRAM, et un template ComfyUI en FP16/INT8.

2 min de lecturePertinence 58
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

La licence communautaire de MiniMax-Music3 autorise un usage commercial, à condition d'afficher la mention "MiniMax-Music3" dans l'interface du produit ; toute entreprise dont les revenus annuels dépassent 20 millions de dollars doit obtenir une autorisation écrite préalable, et quiconque héberge la génération pour des tiers doit mettre en place des garde-fous contre les contenus contrefaisants. Le modèle vise en priorité les créateurs indépendants et les équipes de taille moyenne, dans le jeu vidéo, la publicité, la vidéo courte, l'e-learning, le podcast, le bien-être ou le SaaS musical, pour produire des musiques de fond, des bandes sonores adaptatives, des habillages publicitaires ou des maquettes de composition. En livrant des poids directement exploitables plutôt qu'un simple aperçu de recherche, MiniMax abaisse la barrière d'entrée pour produire des morceaux complets et cohérents, un terrain jusque-là dominé par des services propriétaires fermés.

Le choix technique le plus notable porte sur l'étage de synthèse : au lieu de décoder les tokens discrets issus d'une quantification vectorielle résiduelle à huit couches, dont un codebook sémantique de 16 384 entrées et sept codebooks acoustiques de 1 024 entrées chacun, MiniMax-Music3 fusionne les états cachés des deux modèles de langage pour alimenter directement le module de flow matching, sans jamais charger le décodeur discret à l'inférence. Une incertitude demeure sur le modèle de base du grand modèle de langage : la fiche du modèle et la licence citent Qwen3-8B, tandis que le billet de recherche de MiniMax mentionne Qwen3.5-8B. L'entreprise fournit aussi un agent auxiliaire capable de transformer une description courte en légende structurée complète, dans un marché de la génération musicale par IA où qualité audio, degré de contrôle utilisateur et conditions de licence deviennent les principaux terrains de différenciation entre plateformes.

Impact France / UEChamp produit par Le Fil IA

Les créateurs et studios européens peuvent télécharger et utiliser librement ces poids ouverts pour produire de la musique, sans qu'aucune entité française ou européenne ne soit impliquée dans ce lancement.

À lire ensuite

01MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif38MarkTechPostCréation 02Microsoft lance MAI-Image-2-Efficient, un modèle de génération d'images plus rapide et moins coûteux48VentureBeat AICréation 03NVIDIA lance SANA-WM : un modèle mondial open source de 2,6 milliards de paramètres capable de générer des vidéos 720p de plusieurs minutes sur un seul GPU46MarkTechPostCréation 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.