Aller au contenu principal

Dossier Mistral AI — page 5

212 articles · page 5 sur 5

Mistral AI, la licorne française : modèles open-weight, partenariats stratégiques, bataille européenne pour la souveraineté IA face aux géants américains.

NVIDIA lance Nemotron 3 Embed, une collection d'embeddings ouverts dont le modèle 8B se classe premier sur RTEB
201MarkTechPost LLMsActu

NVIDIA lance Nemotron 3 Embed, une collection d'embeddings ouverts dont le modèle 8B se classe premier sur RTEB

NVIDIA a publié Nemotron 3 Embed, une collection de modèles d'embedding conçue pour la recherche documentaire à grande échelle, le RAG agentique, la recherche de code et la mémoire des agents IA. La collection comprend trois modèles ouverts sous licence OpenMDW 1.1 : Nemotron-3-Embed-8B-BF16, la version privilégiant la précision maximale, Nemotron-3-Embed-1B-BF16, une version compacte au design identique, et Nemotron-3-Embed-1B-NVFP4, une variante quantifiée en 4 bits optimisée pour l'architecture Blackwell. Les trois sont des encodeurs transformer à attention bidirectionnelle, avec une longueur de séquence maximale de 32 768 tokens et une évaluation menée sur 34 langues. Les modèles s'appuient sur les bases Mistral : Ministral-3-8B-Instruct-2512 pour la version 8B, et Ministral-3-3B-Instruct-2512 pour les deux versions 1B. Sur le benchmark RTEB (Retrieval Embedding Benchmark), qui couvre 16 tâches publiques, la version 8B affiche un score NDCG@10 de 78,46, la plaçant en tête de classement au 17 juillet 2026. La version 1B atteint 72,38, tandis que sa déclinaison NVFP4 obtient 72,00, ne perdant que 0,38 point tout en conservant 99,5% de la précision du modèle de référence. Ces performances comptent parce que la qualité des embeddings détermine directement ce qu'un agent IA peut retrouver et exploiter comme information avant même de raisonner dessus. Un gain comme celui du modèle 1B, qui devance de 10,4 points l'ancienne génération llama-nemotron-embed-vl-1b-v2, permet de déployer des systèmes de recherche plus performants sur du matériel plus modeste, un enjeu direct pour les entreprises qui veulent industrialiser le RAG sans multiplier les coûts de calcul. La quasi-absence de perte de précision avec la quantification NVFP4, couplée à un débit jusqu'à deux fois supérieur au format BF16 sur les puces Blackwell selon NVIDIA, ouvre la voie à des déploiements massifs à moindre coût, un argument de poids pour les fournisseurs de cloud et les équipes qui opèrent des infrastructures d'IA agentique à grande échelle. Les gains obtenus sur les petits modèles ne viennent pas d'un entraînement réduit mais d'un pipeline de compression en plusieurs étapes. Le modèle 3B nemotron-3-embed-3b a d'abord été élagué à 2 milliards de paramètres via une recherche d'architecture neuronale (NAS) de NVIDIA ModelOpt, évaluant largeur cachée, taille des couches, nombre de têtes d'attention et profondeur sur un corpus de calibration de 50 000 exemples. Le modèle a ensuite été distillé à partir du modèle 8B, combinant perte de distance cosinus et erreur quadratique moyenne, avant de répéter l'opération pour obtenir la version 1,14 milliard de paramètres finale. Pour la variante NVFP4, la quantification a ciblé les poids et activations des couches linéaires via nvidia-modelopt v0.45.0, suivie d'une distillation adaptée à la quantification (QAD) sur 20 000 exemples pour préserver la précision sur les textes longs, calibrée avec 512 échantillons issus du jeu de données CNN/DailyMail. Les vecteurs de la version 2048 dimensions peuvent aussi être tronqués à 1024 ou 512 dimensions, un choix qui s'inscrit dans la tendance plus large des laboratoires d'IA à optimiser le coût d'inférence sans sacrifier la qualité de récupération.

« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »
202AWS ML Blog 

« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »

Les organisations qui exploitent des dizaines, voire des centaines de comptes AWS font face à un dilemme récurrent pour l'accès aux modèles d'intelligence artificielle sur Amazon Bedrock. AWS distingue trois catégories de modèles : les modèles Amazon comme Nova, les modèles vendus par Amazon tels que ceux de Meta, Mistral ou DeepSeek, accessibles immédiatement avec de simples permissions Bedrock, et les modèles tiers commercialisés via AWS Marketplace, comme Claude d'Anthropic, ceux de Cohere ou de Stability AI, qui exigent un abonnement Marketplace distinct dans chaque compte. Jusqu'ici, les équipes devaient soit accorder largement des permissions Marketplace à tous les comptes de travail, au risque de fragiliser la gouvernance, soit activer manuellement chaque abonnement compte par compte, une charge opérationnelle lourde qui ralentit l'adoption de l'IA à grande échelle. AWS présente désormais les "managed entitlements" pour Bedrock, une fonctionnalité qui permet de souscrire une seule fois depuis un compte central puis de distribuer l'accès aux modèles à travers toute l'organisation, via AWS License Manager, sans qu'aucune permission Marketplace ne soit nécessaire dans les comptes membres. Cette nouveauté change concrètement la donne pour les équipes cloud et sécurité chargées de gouverner l'usage de l'IA générative à l'échelle d'un groupe. Elle s'adresse en priorité aux organisations qui font tourner des charges de travail sur de multiples comptes AWS, qui veulent éviter de diffuser des droits Marketplace à chaque équipe, qui ont négocié des tarifs préférentiels via une offre privée et souhaitent les appliquer uniformément, ou qui ont besoin d'une visibilité centralisée sur qui accède à quels modèles. À l'inverse, les structures qui n'utilisent que des modèles Amazon ou partenaires, qui opèrent sur un compte unique, ou dont les équipes gèrent déjà leurs abonnements de façon autonome n'ont pas vraiment besoin de ce mécanisme. Le bénéfice principal réside dans la réduction du risque de mauvaise configuration et dans l'accélération du déploiement de modèles comme Claude à travers de grandes organisations, tout en gardant un contrôle centralisé. Sur le plan technique, la mise en place suppose qu'AWS Organizations soit configuré avec toutes les fonctionnalités activées, qu'un accès au compte de gestion soit disponible avec les permissions AWS Marketplace et AWS License Manager, et que des rôles liés aux services (service-linked roles) soient créés pour ces deux services. Le concept central repose sur deux notions : la licence, qui représente le droit de l'organisation à utiliser un modèle donné, et les attributions ("grants"), le mécanisme par lequel ce droit est partagé avec des comptes spécifiques. Cette approche s'inscrit dans la suite logique d'autres outils Bedrock comme l'évaluation de modèles ou les garde-fous (guardrails), qui visent tous à concilier autonomie des équipes et gouvernance centralisée des déploiements d'IA en entreprise.

InfrastructureActu
1 source
Le professeur de la productivité maximale : Anjney Midha, AMP
203Latent Space 

Le professeur de la productivité maximale : Anjney Midha, AMP

Lors d'un épisode enregistré chez Periodic Labs à San Francisco, Anjney Midha, fondateur d'AMP et ancien architecte de la plateforme développeur de Discord, a livré une analyse décapante de l'efficacité réelle de l'infrastructure IA mondiale. Le constat de départ est frappant : xAI, le laboratoire d'Elon Musk, fonctionnerait à moins de 10 % de MFU (Model FLOPs Utilization), soit moins d'un dixième de la puissance de calcul théorique de ses GPU effectivement convertie en progrès d'entraînement. Pour comparaison, GPT-3 atteignait déjà 21 % de MFU, Gopher 32 %, PaLM 46 %, et les meilleurs systèmes actuels se situent entre 60 et 70 % selon Midha. AMP, la société qu'il dirige, ambitionne de construire un réseau de calcul indépendant capable de délivrer 1,2 GW en charge de base, avec une capacité de pointe visée à 6 GW. Ce chiffre de sous-utilisation illustre un problème structurel plus profond : acheter davantage de GPU ne garantit pas de meilleurs modèles. L'IA de frontière est avant tout un problème de systèmes, où l'ordonnancement, les réseaux, les noyaux logiciels, les pipelines de données et la fiabilité des clusters déterminent si les FLOPs théoriques se transforment en progrès réel. Midha rappelle qu'à Google, un taux d'utilisation de 95 % était traité comme une panne, tant l'optimisation était culturellement ancrée. Il propose le concept d'"outputmaxxing" comme nouvelle discipline à part entière : maximiser les sorties utiles par flop dépensé, plutôt que d'accumuler aveuglément de la capacité brute. À mesure que les organisations s'appuient sur des couches d'abstraction et des API, elles perdent de la performance à chaque niveau de la pile, sans toujours en mesurer les conséquences sur la qualité des modèles. Investisseur dans Anthropic, Mistral, Black Forest Labs et Periodic Labs, Midha a observé de près comment un excès de capital trop précoce peut fragiliser un laboratoire plutôt que le renforcer. AMP se positionne comme un opérateur de réseau de calcul indépendant, sur le modèle des gestionnaires de réseau électrique, permettant aux FLOPs de "circuler comme des mégawatts". Cette vision implique des protocoles ouverts, une intégration communautaire autour des centres de données, et des marchés de calcul où la demande interruptible remplace l'achat brut de capacité. Midha évoque également une "défaillance de marché" pointée par des recherches non publiées de DeepMind, et défend l'idée que la prédiction de fin de vie en médecine pourrait devenir l'une des applications les plus importantes de l'IA dans les prochaines années, un sujet qu'il suit depuis quatorze ans.

InfrastructureOpinion
1 source
Construire des transformers économes en mémoire avec xFormers : séquences compactes, GQA, ALiBi, SwiGLU et attention causale
204MarkTechPost 

Construire des transformers économes en mémoire avec xFormers : séquences compactes, GQA, ALiBi, SwiGLU et attention causale

Un tutoriel publié récemment détaille comment exploiter xFormers, la bibliothèque open source de Meta, pour construire des modèles Transformer à la fois rapides et économes en mémoire GPU. L'auteur y implémente pas à pas cinq optimisations clés : l'attention mémoire-efficiente, le masquage causal, les séquences de longueur variable compressées (packed sequences), l'attention multi-requêtes groupées (GQA), et les biais positionnels ALiBi. Le tout culmine dans un modèle de type GPT complet, entraînable, qui intègre également des couches feed-forward SwiGLU et l'entraînement en précision mixte automatique. Les benchmarks sont conduits sur GPU CUDA avec PyTorch, en comparant xFormers à une implémentation d'attention naïve sur des longueurs de séquences allant de 512 à 4 096 tokens. L'enjeu central est la mémoire. L'attention standard matérialise en mémoire une matrice de scores de taille M×M (nombre de tokens au carré), ce qui devient rapidement prohibitif à mesure que les séquences s'allongent : doubler la longueur quadruple la consommation mémoire. L'attention mémoire-efficiente de xFormers calcule le même résultat exact sans jamais stocker cette matrice complète, grâce à une réécriture algorithmique de type FlashAttention. En pratique, cela permet d'entraîner des modèles sur des séquences bien plus longues avec le même matériel, ou d'augmenter la taille des batches, ce qui accélère la convergence. Pour les chercheurs et les ingénieurs qui travaillent avec des ressources GPU limitées, notamment sur du matériel grand public ou des serveurs partagés, ces gains ne sont pas marginaux : ils peuvent rendre faisable ce qui ne l'était pas. xFormers est développé par Meta AI et s'inscrit dans un mouvement plus large d'optimisation des Transformers, apparu après la publication de FlashAttention par Tri Dao et ses collègues de Stanford en 2022. Depuis, plusieurs bibliothèques concurrentes ont émergé (FlashAttention-2, FlashAttention-3, Triton), mais xFormers se distingue par son intégration directe dans l'écosystème PyTorch et par la richesse de ses primitives prêtes à l'emploi : GQA pour réduire le coût des têtes d'attention, ALiBi pour généraliser à des longueurs de séquences non vues à l'entraînement, SwiGLU pour améliorer la qualité des représentations. Ces briques sont précisément celles qu'utilisent des modèles de référence comme LLaMA ou Mistral. Ce tutoriel illustre comment les assembler concrètement, comblant ainsi le fossé entre la théorie des papiers de recherche et leur mise en oeuvre opérationnelle.

UECes optimisations de mémoire GPU, utilisées notamment par Mistral, bénéficient aux équipes de recherche européennes qui entraînent des modèles avec des ressources GPU limitées.

OutilsTuto
1 source
Accélérer l'entraînement des transformers avec NVIDIA Apex et torch.amp
205MarkTechPost 

Accélérer l'entraînement des transformers avec NVIDIA Apex et torch.amp

Un tutoriel récemment publié propose une approche structurée pour accélérer l'entraînement de modèles Transformer sur GPU en s'appuyant sur NVIDIA Apex, une bibliothèque d'optimisation spécialisée. Le guide couvre en particulier trois composants : FusedAdam, un optimiseur de remplacement pour AdamW, FusedLayerNorm et FusedRMSNorm pour les couches de normalisation, ainsi que l'API de précision mixte torch.amp désormais intégrée nativement dans PyTorch. La démarche commence par la compilation d'Apex depuis les sources avec les extensions CUDA et C++, étape critique car une installation Python seule peut sembler réussie tout en ignorant silencieusement les noyaux haute performance qui font la valeur réelle de la bibliothèque. Le tutoriel inclut ensuite des benchmarks comparant FusedAdam face à PyTorch AdamW, les couches de normalisation fusionnées face aux variantes standard, puis une expérience complète d'entraînement Transformer qui mesure l'écart de débit entre un pipeline FP32 classique et une configuration combinant Apex et AMP. Les gains en jeu sont concrets : les noyaux CUDA fusionnés permettent de réduire le nombre d'opérations mémoire en combinant plusieurs calculs en un seul passage sur le GPU, ce qui se traduit directement en un débit d'entraînement supérieur et en une réduction du temps par itération. Pour les équipes qui entraînent de grands modèles de langage ou des Transformers profonds sur des infrastructures NVIDIA, ces optimisations peuvent représenter une économie significative en heures de calcul et donc en coût de GPU. La précision mixte, qui permet d'effectuer certains calculs en FP16 tout en maintenant la stabilité numérique en FP32 pour les parties sensibles, réduit également la consommation mémoire et autorise des batchs plus grands, accélérant la convergence. NVIDIA Apex est un projet open source maintenu par NVIDIA qui a longtemps servi de référence pour l'entraînement en précision mixte avant que PyTorch n'intègre nativement des fonctionnalités équivalentes via torch.amp. Aujourd'hui, certaines parties d'Apex restent pertinentes, notamment les noyaux CUDA fusionnés pour l'optimiseur et la normalisation, là où PyTorch n'offre pas encore d'alternative directe. Le tutoriel prend soin de distinguer les composants encore utiles des parties obsolètes, un arbitrage important dans un écosystème qui évolue rapidement. Avec l'essor des architectures de type GPT, Llama ou Mistral et la multiplication des entraînements à grande échelle, la demande d'outils d'optimisation bas niveau reste forte, et des bibliothèques comme Apex continuent d'alimenter les pipelines des équipes cherchant à extraire chaque milliseconde de leurs GPU NVIDIA.

OutilsTuto
1 source
Construire des Transformers à profondeur récurrente avec OpenMythos : MLA, GQA, Sparse MoE et raisonnement itératif
206MarkTechPost 

Construire des Transformers à profondeur récurrente avec OpenMythos : MLA, GQA, Sparse MoE et raisonnement itératif

OpenMythos est une bibliothèque Python open source permettant de construire des transformers dits "recurrent-depth", une architecture hybride qui combine des blocs d'attention avancés avec une boucle récurrente contrôlée. Un tutoriel publié récemment montre comment déployer cette bibliothèque de bout en bout dans Google Colab pour entraîner deux variantes de modèles : l'une utilisant l'attention multi-latente (MLA, inspirée de DeepSeek-V2) avec cache KV compressé, l'autre utilisant l'attention par groupes de requêtes (GQA, avec moins de têtes KV que de têtes Q). Les deux variantes intègrent également un Mixture of Experts épars (4 experts au total, 2 activés par token, 1 expert partagé), avec une dimension cachée de 128, 4 têtes d'attention, et une longueur de séquence maximale de 32 tokens. Le tutoriel valide les modèles sur une tâche de raisonnement compositionnel synthétique : prédire la somme d'une chaîne de chiffres modulo 7, une tâche conçue pour forcer le modèle à enchaîner plusieurs étapes de calcul intermédiaires. Ce type d'architecture présente un avantage concret majeur : la réutilisation des paramètres via les boucles récurrentes. Là où un transformer classique empile physiquement N couches distinctes pour N niveaux de profondeur de traitement, un modèle recurrent-depth peut traverser les mêmes couches plusieurs fois (jusqu'à 8 itérations de boucle dans ce tutoriel), simulant une profondeur de calcul bien supérieure à son nombre réel de paramètres. Le tutoriel mesure notamment le rayon spectral de la matrice d'injection récurrente, un indicateur de stabilité numérique qui doit rester inférieur à 1 pour garantir que les activations ne divergent pas au fil des boucles. Cette approche ouvre la voie à des modèles capables d'allouer dynamiquement plus de "réflexion" à des problèmes complexes sans augmenter leur empreinte mémoire permanente. L'architecture s'inscrit dans un mouvement plus large de recherche sur l'efficacité computationnelle des grands modèles de langage. L'attention MLA a été popularisée par DeepSeek-V2, un modèle chinois open source qui a démontré en 2024 qu'une compression agressive du cache KV pouvait réduire les coûts d'inférence sans dégradation notable des performances. La combinaison avec un Mixture of Experts épars rappelle l'architecture de Mixtral (Mistral AI) et de ses successeurs, où seule une fraction des paramètres est activée par token. OpenMythos cherche à réunir ces techniques dans un cadre expérimental accessible, destiné aux chercheurs et ingénieurs qui souhaitent explorer les interactions entre profondeur récurrente, routage par experts et variantes d'attention compressée, sans avoir à implémenter chaque composant depuis zéro.

UELes chercheurs et ingénieurs européens peuvent utiliser cette bibliothèque open source pour expérimenter des architectures hybrides récurrentes sans reconstruire les composants depuis zéro, réduisant la barrière à la recherche indépendante.

RecherchePaper
1 source
Alibaba, ByteDance et Zhipu AI figurent dans le premier classement IA du magazine Time
207SCMP Tech 

Alibaba, ByteDance et Zhipu AI figurent dans le premier classement IA du magazine Time

Le magazine Time a publié pour la première fois un classement dédié à l'intelligence artificielle, intitulé "10 Most Influential AI Companies of 2026", dans le cadre de son palmarès annuel Time100 Most Influential Companies. Trois entreprises chinoises y figurent : Alibaba Group Holding, ByteDance et Zhipu AI. Les sept autres places sont occupées par six sociétés américaines et par Mistral AI, seule représentante européenne du classement. La présence de trois acteurs chinois dans ce top 10 mondial illustre la montée en puissance de l'écosystème IA de Pékin face à la Silicon Valley. ByteDance, connu pour TikTok, s'est imposé dans la course aux grands modèles de langage avec son modèle Doubao. Alibaba pousse son modèle Qwen, disponible en open source, tandis que Zhipu AI, startup soutenue par des fonds d'État, développe la série GLM. Leur inclusion dans un classement américain aussi emblématique que le Time100 signale que la domination américaine sur l'IA n'est plus une évidence pour les observateurs occidentaux eux-mêmes. Ce classement intervient dans un contexte de compétition technologique intense entre les États-Unis et la Chine, aggravée par les restrictions américaines sur les exportations de puces Nvidia vers Pékin. Malgré ces obstacles, les laboratoires chinois ont continué à publier des modèles compétitifs, notamment après le choc DeepSeek début 2025. L'entrée de Mistral AI dans ce palmarès confirme également que l'Europe cherche à s'imposer comme troisième pôle de l'IA mondiale, même si son poids reste modeste face aux deux géants.

UEMistral AI est la seule entreprise européenne dans le classement Time100 IA 2026, signal de reconnaissance internationale pour l'écosystème français mais aussi de la faiblesse relative de l'Europe face aux géants américains et chinois.

BusinessActu
1 source
208Ahead of AI 

Mon approche pour comprendre les architectures de LLM

Sebastian Raschka, chercheur et auteur reconnu dans le domaine de l'apprentissage automatique, a publié un article détaillant sa méthode de travail pour comprendre et visualiser les architectures des grands modèles de langage (LLM). Sa démarche, qu'il applique pour produire les schémas et dessins publiés dans ses articles et sa LLM-Gallery, part toujours des rapports techniques officiels, avant de plonger dans les fichiers de configuration et les implémentations de référence disponibles sur Hugging Face. Concrètement, lorsque les poids d'un modèle sont accessibles sur le Model Hub et que le modèle est supporté par la bibliothèque Python transformers, il est possible d'inspecter directement le fichier config.json et le code source pour obtenir des informations précises sur l'architecture, là où les articles scientifiques restent souvent vagues. Cette approche répond à un problème croissant : les publications académiques des laboratoires industriels sont de moins en moins détaillées sur le plan technique, en particulier pour les modèles open-weight. En s'appuyant sur le code de référence plutôt que sur les papiers, on accède à une vérité que le code ne peut pas dissimuler. Cette méthode permet à quiconque, chercheur, ingénieur ou passionné, de reconstituer fidèlement l'architecture d'un modèle comme LLaMA, Mistral ou Qwen, sans dépendre de descriptions parfois incomplètes ou ambiguës. En revanche, elle ne s'applique pas aux modèles propriétaires comme ChatGPT, Claude ou Gemini, dont les poids et les détails d'implémentation restent confidentiels. Le processus reste volontairement manuel. Raschka insiste sur ce point : même si certaines étapes pourraient être automatisées, réaliser cet exercice à la main reste l'une des meilleures façons d'apprendre vraiment comment ces architectures fonctionnent. Dans un contexte où la complexité des LLM ne cesse de croître et où la transparence des laboratoires diminue, ce type de rétro-ingénierie pédagogique devient un outil précieux pour maintenir une compréhension technique rigoureuse de l'état de l'art. Raschka prévoit de documenter ce flux de travail de façon plus complète pour la communauté.

💬 Le code ment jamais, les papiers si. C'est exactement le problème que Raschka met le doigt dessus : les labos publient de moins en moins les vrais détails, et le seul moyen de savoir ce qui tourne vraiment sous le capot, c'est d'aller lire le config.json directement sur HuggingFace. La partie "volontairement manuel", bon, certains vont trouver ça old school, mais c'est probablement la seule façon de vraiment comprendre plutôt que de juste faire tourner un script.

LLMsTuto
1 source
209MarkTechPost 

Entraînement, alignement et déploiement des LLM : analyse technique approfondie

L'entraînement d'un grand modèle de langage (LLM) moderne repose sur un pipeline en plusieurs étapes distinctes, chacune jouant un rôle précis dans la transformation d'un réseau de neurones brut en un système intelligent et déployable. La première phase, le pré-entraînement, consiste à exposer le modèle à des corpus massifs de textes, livres, sites web, code source, afin qu'il développe une compréhension générale du langage, de la grammaire, du raisonnement et des connaissances du monde. Vient ensuite le fine-tuning supervisé (SFT), où des paires entrée-sortie soigneusement vérifiées permettent d'orienter le comportement du modèle vers des tâches précises, un style de réponse ou des règles métier spécifiques. Pour rendre cette adaptation plus accessible sans recalculer l'intégralité des paramètres du modèle, des techniques comme LoRA (Low-Rank Adaptation) et QLoRA (sa variante quantifiée) permettent un fine-tuning efficace en n'ajustant qu'une fraction des poids. L'alignement avec les préférences humaines passe quant à lui par le RLHF (Reinforcement Learning from Human Feedback), qui affine les sorties selon des critères de sécurité et d'utilité. Plus récemment, GRPO (Group Relative Policy Optimization) est apparu pour renforcer les capacités de raisonnement structuré et de résolution de problèmes en plusieurs étapes. Comprendre ce pipeline est essentiel pour quiconque développe ou intègre des LLMs dans des produits réels. Chaque étape conditionne la suivante : un pré-entraînement faible rend le fine-tuning peu efficace, et un mauvais alignement produit des modèles imprévisibles ou dangereux en production. Le SFT, par exemple, peut transformer une réponse générique ("Essayez de réinitialiser votre mot de passe") en une réponse structurée et empathique adaptée au service client. Les techniques LoRA et QLoRA démocratisent l'adaptation de modèles de grande taille sur du matériel accessible, réduisant les coûts de calcul de manière significative. Le RLHF, popularisé notamment par OpenAI avec ChatGPT, reste la référence pour aligner les modèles sur les attentes humaines, tandis que GRPO représente la nouvelle frontière pour les modèles de raisonnement comme DeepSeek-R1 ou les variantes o1 d'OpenAI. Ce pipeline s'est construit progressivement depuis les premières architectures Transformer de 2017, avec des jalons comme GPT-3 en 2020, qui a démontré la puissance du pré-entraînement à grande échelle, puis InstructGPT en 2022, qui a introduit le RLHF comme standard d'alignement. Aujourd'hui, la course entre les acteurs majeurs, OpenAI, Google DeepMind, Meta, Mistral, Anthropic, se joue précisément sur l'optimisation de ces étapes : qualité des données d'entraînement, efficacité du fine-tuning, robustesse de l'alignement. La montée en puissance des modèles de raisonnement en 2024-2025 a replacé GRPO et les approches similaires au centre des stratégies de recherche, laissant entrevoir des LLMs capables d'une résolution de problèmes complexes nettement plus fiable qu'aujourd'hui.

UEMistral, acteur français, est cité parmi les compétiteurs majeurs dans la course à l'optimisation des pipelines d'entraînement LLM.

LLMsTuto
1 source
LaCy : ce que les petits modèles de langage peuvent et doivent apprendre ne se réduit pas à une question de perte
210Apple Machine Learning 

LaCy : ce que les petits modèles de langage peuvent et doivent apprendre ne se réduit pas à une question de perte

Une étude présentée au workshop "Memory for LLM-Based Agentic Systems" de la conférence ICLR 2025 s'attaque à une question fondamentale pour les petits modèles de langage (SLM) : que doivent-ils apprendre lors du préentraînement, et que doivent-ils déléguer à des sources externes ? Les chercheurs ont développé LaCy, un cadre théorique et expérimental qui questionne la fonction de perte standard utilisée pour entraîner ces modèles, en montrant qu'optimiser uniquement la vraisemblance des données n'est pas suffisant pour des SLM efficaces et fiables. Le problème est structurel : contrairement aux grands modèles comme GPT-4 ou Llama 3, les SLM disposent d'une capacité paramétrique limitée, ce qui les contraint à faire des choix sur les connaissances à mémoriser. Sans mécanisme adapté, ils génèrent des faits incorrects plutôt que d'admettre leur ignorance et de consulter une base de données ou un modèle plus puissant. LaCy propose de reformuler ce que le modèle "devrait" apprendre en tenant compte explicitement de la disponibilité de sources externes, comme des documents récupérés par RAG ou des API spécialisées. Ce travail s'inscrit dans la tendance croissante à déployer des agents IA embarqués sur des appareils à faible puissance, où les gros modèles ne peuvent pas tourner localement. Alors que des entreprises comme Google, Apple ou Mistral misent sur des SLM pour l'edge computing et les assistants embarqués, la question de la frontière entre mémoire paramétrique et mémoire externe devient stratégique. LaCy ouvre la voie à des entraînements plus ciblés, où le modèle apprend à savoir ce qu'il ne sait pas.

UEMistral, entreprise française en pointe sur les petits modèles pour l'edge computing, est directement concernée par les conclusions de LaCy sur l'optimisation de l'entraînement des SLM.

RecherchePaper
1 source
Top 3 : Agence automatisation IA et Agents IA 2026
211Le Big Data 

Top 3 : Agence automatisation IA et Agents IA 2026

En mars 2026, le site ActuIA a publié un classement des trois meilleures agences d'automatisation par intelligence artificielle et de déploiement d'agents IA à destination des entreprises. Le podium réunit Royal Air Force, Markovate et Stema. En tête, Royal Air Force s'impose comme la référence francophone du secteur grâce à un modèle dit d'« externalisation augmentée » : ses équipes déploient des automatisations complètes via des outils comme n8n, Make, Zapier et Claude, tout en mettant à disposition des profils hybrides combinant expertise humaine et IA pour des postes opérationnels — community management, développement web, rédaction, montage vidéo. L'agence propose également la formation des équipes internes pour garantir une autonomie post-déploiement. En deuxième position, l'américano-canadienne Markovate, implantée à Toronto et San Francisco, se spécialise dans l'IA agentique appliquée au e-commerce : gestion de stock prédictive, tarification dynamique, LLM propriétaires et recherche sémantique pour les grandes enseignes de retail. Stema complète le classement en tant qu'agence polyvalente. Ce type de classement reflète une transformation profonde du marché des services aux entreprises : l'automatisation par IA n'est plus réservée aux grands groupes technologiques, elle devient accessible à des PME et ETI cherchant à optimiser leurs workflows métier sans recruter de data scientists en interne. L'émergence d'agences spécialisées — qui facturent du conseil, de l'intégration et du suivi — crée un nouveau segment de l'industrie IT à forte croissance. Pour les entreprises, l'enjeu est concret : réduire les tâches répétitives, accélérer les cycles de décision et personnaliser l'expérience client à grande échelle, sans refonte complète du système d'information. Ce marché des agences IA s'est structuré rapidement sous l'effet de la démocratisation des API de grands modèles de langage (OpenAI, Anthropic, Mistral) et de la maturité des outils d'orchestration no-code comme Make ou n8n. La demande explose depuis 2023, portée par des entreprises qui ont validé les cas d'usage mais manquent de ressources internes pour déployer. La compétition s'intensifie entre acteurs francophones, qui misent sur la proximité culturelle et la maîtrise réglementaire européenne (RGPD, AI Act), et des agences anglophones à plus fort volume. La prochaine étape probable est la spécialisation sectorielle accrue — santé, finance, industrie — et la montée en puissance des agents IA autonomes capables d'enchaîner des tâches complexes sur plusieurs jours sans intervention humaine.

UERoyal Air Force, agence francophone classée première, cible explicitement les PME et ETI françaises en mettant en avant sa conformité RGPD et AI Act comme avantage concurrentiel.

OutilsOutil
1 source
Votre ordinateur ou smartphone peut-il faire tourner une IA ? Ce site vous donne la réponse en un clic
212Frandroid 

Votre ordinateur ou smartphone peut-il faire tourner une IA ? Ce site vous donne la réponse en un clic

CanIRun.ai est un nouveau site qui permet de vérifier en un clic si votre appareil — smartphone, tablette ou PC — est capable de faire tourner une intelligence artificielle en local, sans passer par le cloud. C'est une information concrète et utile pour des millions d'utilisateurs qui souhaitent expérimenter des modèles d'IA comme LLaMA ou Mistral directement sur leur machine, sans dépendre de serveurs distants ni payer d'abonnement. Savoir si son matériel est compatible évite des heures de configuration inutile. L'IA locale gagne en popularité depuis la prolifération de modèles open source légers et performants, mais les exigences en RAM, GPU et stockage restent un frein pour le grand public.

UELes utilisateurs européens peuvent directement vérifier la compatibilité de leur appareil pour faire tourner des modèles open source comme Mistral en local.

OutilsOutil
1 source