Aller au contenu principal
OutilsTechCrunch AI · 1 min de lecture

Multiverse Computing propulse ses modèles d'IA compressés vers le grand public

Source originale ↗·

Multiverse Computing franchit une nouvelle étape dans la démocratisation de l'intelligence artificielle en rendant accessibles au grand public ses modèles compressés issus des plus grands laboratoires de l'IA mondiale. La société a lancé simultanément une application grand public et une API permettant d'exploiter ces modèles allégés à plus grande échelle.

La compression de modèles représente un enjeu stratégique majeur pour le secteur : en réduisant la taille des modèles sans sacrifier leurs performances, elle permet de les déployer sur des infrastructures moins coûteuses, de diminuer la consommation énergétique et d'élargir l'accès à des acteurs qui ne disposent pas de ressources de calcul massives. La démarche de Multiverse Computing s'inscrit ainsi dans une tendance de fond visant à rendre l'IA haute performance plus accessible et plus frugale.

Les modèles compressés proposés par la société sont issus de quatre des acteurs les plus influents du domaine : OpenAI, Meta, DeepSeek et Mistral AI. L'application dévoilée permet de démontrer concrètement les capacités de ces versions optimisées, tandis que l'API ouvre la voie à une intégration par des développeurs et des entreprises souhaitant bénéficier de ces modèles sans les contraintes habituelles de déploiement.

Cette double mise sur le marché, application et API, suggère que Multiverse Computing mise sur deux segments distincts : les utilisateurs finaux curieux d'évaluer les modèles compressés, et les professionnels cherchant à les intégrer dans leurs propres produits. La stratégie pourrait repositionner la compression de modèles non plus comme un simple outil d'optimisation interne, mais comme une offre commerciale à part entière.

Impact France/UE

Multiverse Computing, entreprise européenne spécialisée dans la compression de modèles IA, rend ses outils accessibles via une API — opportunité directe pour les développeurs et entreprises européennes cherchant à réduire les coûts d'inférence.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

IBM publie Grandite 4.0 : 1 milliard de locutions pour un modèle vocal multilingue compact destiné à l'IA edge et aux pipelines de traduction
1MarkTechPost 

IBM publie Grandite 4.0 : 1 milliard de locutions pour un modèle vocal multilingue compact destiné à l'IA edge et aux pipelines de traduction

IBM vient de publier Granite 4.0 1B Speech, un modèle de reconnaissance et de traduction vocale multilingue conçu pour les déploiements en conditions contraintes, edge computing, faible latence, empreinte mémoire réduite. La particularité de cette version : elle divise par deux le nombre de paramètres de son prédécesseur granite-speech-3.3-2b, tout en étendant les capacités du modèle. Cette sortie s'inscrit dans une tendance de fond dans l'industrie : l'optimisation des modèles pour des environnements hors cloud ou à ressources limitées. Pour les entreprises cherchant à intégrer de la transcription ou de la traduction vocale sans dépendre d'une API externe, pour des raisons de confidentialité, de coût ou de connectivité, un modèle compact et performant sous licence Apache 2.0 représente une alternative crédible aux solutions propriétaires. Le modèle prend en charge la reconnaissance automatique de la parole (ASR) en anglais, français, allemand, espagnol, portugais et japonais, ainsi que la traduction bidirectionnelle (AST) depuis et vers l'anglais pour ces langues, avec des scénarios supplémentaires vers l'italien et le mandarin. Sur le plan des performances, Granite 4.0 1B Speech a récemment décroché la première place du classement OpenASR, avec un taux d'erreur moyen (WER) de 5,52 et un score de vitesse temps réel (RTFx) de 280,02. Sur le corpus de référence LibriSpeech Clean, le WER tombe à 1,42. Techniquement, le modèle repose sur une architecture à deux passes : la transcription audio d'abord, puis un appel séparé au modèle de langage Granite 4.0 pour tout traitement textuel en aval. Le déploiement est supporté nativement via transformers ≥ 4.52.1 et vLLM, avec une interface compatible OpenAI API pour la mise en production. L'ajout du keyword biasing, permettant de guider la transcription vers un vocabulaire métier spécifique directement dans le prompt, et du décodage spéculatif pour accélérer l'inférence renforce l'attrait du modèle pour des usages industriels. IBM positionne ainsi Granite Speech comme une brique modulaire dans des pipelines voix-vers-texte d'entreprise, sans enfermement propriétaire.

UELes entreprises européennes peuvent adopter ce modèle open-source (Apache 2.0) pour déployer de la reconnaissance vocale multilingue en local, sans dépendance cloud, ce qui facilite la conformité RGPD.

OutilsActu
1 source
Pourquoi les institutions financières se tournent vers les modèles de base transactionnels pour développer leur IA
2NVIDIA AI Blog 

Pourquoi les institutions financières se tournent vers les modèles de base transactionnels pour développer leur IA

Revolut et Mastercard font partie des premières institutions financières à adopter une nouvelle catégorie d'intelligence artificielle appelée « transaction foundation models », des systèmes entraînés sur des milliards d'événements financiers plutôt que sur des tâches isolées. Revolut a développé PRAGMA, une famille de modèles basés sur des transformers, en collaboration avec NVIDIA : entraîné sur 24 milliards d'événements issus de 26 millions de comptes dans plus de 100 pays, ce modèle unique surpasse des modèles spécialisés dans des domaines distincts comme le scoring de crédit, la détection de fraude et les recommandations produits. Mastercard travaille de son côté à un grand modèle tabulaire propriétaire, conçu pour évoluer jusqu'à des centaines de milliards de transactions en intégrant des données de fraude, d'autorisation, de remboursement, de localisation de marchands et de fidélité, avec l'appui de NVIDIA, AWS et Databricks. NVIDIA a également publié un exemple de développement open source permettant à n'importe quelle institution de commencer à construire ce type d'architecture sur ses propres données transactionnelles. L'enjeu concret est considérable. Là où un modèle de fraude classique évalue des signaux isolés, un modèle fondationnel interprète le comportement dans son contexte : un paiement à minuit, sur un appareil inconnu, depuis une ville jamais visitée, effectué en quatrième position en dix minutes, prend une signification radicalement différente. Cette profondeur contextuelle améliore les performances sur l'ensemble des tâches, pas seulement sur celle pour laquelle le modèle a été conçu. Pour les équipes data, le bénéfice opérationnel est immédiat : Tadas Kriščiūnas, responsable des données crédit chez Revolut, indique que le travail de feature engineering, qui prenait des semaines voire des mois, est désormais réduit à zéro. Selon le rapport 2026 de NVIDIA sur l'IA dans les services financiers, 65 % des institutions utilisent déjà l'IA et près de 90 % la déploient ou l'évaluent activement. Le secteur financier a passé des années à empiler des modèles spécialisés, un pour la fraude, un pour le crédit, un pour les recommandations, créant des architectures fragmentées incapables de partager leur compréhension du client. Chaque nouveau marché exigeait un réentraînement, chaque nouvel usage un nouveau modèle. L'émergence des transformers appliqués aux données tabulaires change la donne structurellement : une représentation unifiée du comportement financier, entraînée sur des données propriétaires massives, devient un actif stratégique différenciant. Les institutions qui consolident leur intelligence sur ce type de socle réduisent leur dette technique tout en gagnant en capacité d'adaptation, à l'heure où la concurrence entre banques traditionnelles, fintechs et géants technologiques s'intensifie sur le terrain de la personnalisation et de la sécurité.

UERevolut, néobanque européenne active dans plus de 100 pays, a développé PRAGMA avec NVIDIA pour améliorer détection de fraude et scoring crédit sur ses 26 millions de comptes, renforçant la compétitivité des fintechs européennes face aux banques traditionnelles.

OutilsOutil
1 source
Google lance une compétence d'agent dans l'API Gemini pour combler les lacunes des modèles IA sur leurs propres SDK
3The Decoder 

Google lance une compétence d'agent dans l'API Gemini pour combler les lacunes des modèles IA sur leurs propres SDK

Google a introduit une nouvelle fonctionnalité baptisée « Agent Skill » dans son API Gemini, conçue pour combler une lacune structurelle des modèles d'IA : leur ignorance des mises à jour de leurs propres SDK survenues après leur date d'entraînement. Ce mécanisme permet au modèle d'accéder dynamiquement à une documentation à jour sur ses propres outils, améliorant significativement la qualité du code généré pour les applications qui utilisent l'API Gemini. L'impact est concret pour les développeurs : un modèle qui ne connaît pas les dernières versions d'un SDK produit du code obsolète, bogué ou incompatible. En injectant automatiquement les bonnes références au moment de la génération, Google réduit les erreurs d'intégration et accélère le développement d'agents IA, un enjeu critique alors que l'écosystème évolue plusieurs fois par mois. Ce problème de « knowledge cutoff » est universel à tous les grands modèles de langage : ChatGPT, Claude et Gemini souffrent tous d'un décalage entre leur entraînement et l'état réel du monde. La réponse de Google illustre une tendance plus large, plutôt que d'attendre le prochain cycle d'entraînement, les éditeurs construisent des couches de récupération dynamique pour maintenir les modèles à jour en temps réel sur des domaines critiques comme leurs propres API.

UELes développeurs et entreprises françaises intégrant des agents IA dans leurs produits bénéficient directement d'une réduction des erreurs d'intégration liées au knowledge cutoff des SDK.

💬 C'est un problème que je rencontre toutes les semaines en intégrant des SDK qui bougent vite. Google répond d'une façon élégante : plutôt que d'attendre le prochain cycle d'entraînement, ils injectent la doc à jour directement au moment de la génération, ce qui évite les erreurs bêtes sur des méthodes dépréciées depuis trois mois. Reste à voir si ça scale quand tous les éditeurs adoptent cette logique, mais c'est clairement la bonne direction.

OutilsOutil
1 source
IEEE lance un cours de formation en ligne sur les grands modèles de langage
4IEEE Spectrum AI 

IEEE lance un cours de formation en ligne sur les grands modèles de langage

L'IEEE, l'organisation internationale des ingénieurs en électronique et en informatique, lance un programme de formation en ligne intitulé "Large Language Models Demystified", disponible sur son réseau d'apprentissage IEEE Learning Network. Développé en partenariat avec l'IEEE Computer Society, ce cursus de cinq cours s'adresse aux professionnels techniques qui souhaitent comprendre non seulement comment utiliser les modèles de langage, mais comment les concevoir et les intégrer dans des systèmes réels. Le programme couvre l'évolution des architectures transformer, les mécanismes d'attention, l'optimisation des modèles et des exercices pratiques. Ce lancement intervient alors que le marché des LLM est estimé à une croissance annuelle de 33 % jusqu'en 2030, selon le cabinet MarketsandMarkets, ce qui signifie que la maîtrise de ces technologies passe rapidement d'une compétence de niche à une exigence fondamentale pour tout professionnel du numérique. L'enjeu dépasse largement l'usage grand public des assistants conversationnels. Pour les ingénieurs et développeurs, les LLM sont devenus des composants architecturaux à part entière : ils identifient des vulnérabilités dans du code source, transforment des discussions de projet en spécifications techniques formalisées, et automatisent des tâches répétitives qui mobilisaient auparavant des heures de travail humain. Mais utiliser ces systèmes sans en comprendre la logique interne génère des risques concrets. Le phénomène des "hallucinations", où un modèle produit du code ou des faits d'apparence correcte mais fondamentalement erronés, représente un risque de fiabilité majeur en production. Des techniques comme la génération augmentée par récupération (RAG), qui force le modèle à consulter une base de données vérifiée avant de répondre, ou le déploiement d'instances privées pour protéger le code propriétaire des données d'entraînement publiques, sont désormais des compétences attendues des équipes techniques. Ce mouvement s'inscrit dans une transformation plus profonde de la profession d'ingénieur logiciel. L'architecture transformer, qui a remplacé le traitement séquentiel des données par des mécanismes d'attention parallèle capables d'ingérer des corpus massifs simultanément, a rendu possible une nouvelle génération d'outils de développement. Les API permettent aujourd'hui de connecter directement un LLM à des bases de données internes ou à des environnements d'exécution de code, dépassant largement la simple interface de chat. Face à cette mutation rapide, l'écart se creuse entre ceux qui utilisent l'IA comme un outil opaque et ceux qui savent en contrôler les paramètres, en sécuriser les accès et en garantir la cohérence des résultats. La formation proposée par l'IEEE vise précisément à combler ce fossé, en offrant aux professionnels une compréhension de fond qui transforme l'expérimentation en approche d'ingénierie rigoureuse.

UELes ingénieurs et développeurs français et européens peuvent suivre cette formation IEEE pour structurer leur maîtrise des architectures LLM, compétence de plus en plus exigée par les employeurs du secteur numérique en Europe.

💬 Honnêtement, c'est plus intéressant que ça en a l'air. L'IEEE sort le grand jeu avec ce programme de formation sur les grands modèles de langage, "Large Language Models Demystified". On parle pas juste d'utiliser ces outils, mais aussi de les concevoir et de les intégrer vraiment. C'est crucial, avec le marché des LLM qui grimpe à 33% par an jusqu'en 2030, on passe d'une compétence de spécialiste à une nécessité pour tout pro du numérique. Mais attention, utiliser ces modèles sans les comprendre crée des risques concrets : ces "hallucinations", c'est fondamentalement faux mais qui peut sembler correct. Techniques comme le RAG ou le déploiement d'instances privées, c'est devenu indispensable pour sécuriser le code et les données. L'IEEE met le doigt sur un vrai besoin : transformer l'expérimentation en ingénierie rigoureuse avec ces outils de plus en plus centraux dans notre boulot d'ingés logiciels.

OutilsTuto
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic