Aller au contenu principal

Dossier DeepSeek — page 5

243 articles · page 5 sur 5

DeepSeek, le laboratoire chinois qui a secoué les valeurs tech US : modèles open-weight V3, R1, V4, économie du compute et géopolitique de l'IA.

L’IA chinoise, une menace ? Le clash entre Jensen Huang et Jim Cramer
201Le Big Data BusinessOpinion

L’IA chinoise, une menace ? Le clash entre Jensen Huang et Jim Cramer

Jensen Huang, le PDG de Nvidia, et Jim Cramer, célèbre animateur de CNBC, s'affrontent publiquement sur la question des modèles d'intelligence artificielle chinois. Lors d'un entretien accordé à Axios, Jensen Huang a salué les performances du modèle open source chinois Kimi K3, qu'il qualifie d'« excellent », capable d'analyser un million de tokens, soit l'équivalent d'un roman de 500 pages, en quelques secondes, pour une fraction du coût des modèles américains équivalents. Il rejette l'idée que ces IA chinoises menacent la compétitivité des laboratoires américains comme OpenAI ou Anthropic, jugeant que ces derniers conservent une avance suffisante. Jim Cramer a réagi sur X en appelant les entreprises américaines à ne pas adopter les modèles chinois, même s'ils permettent de réduire les coûts, invoquant des raisons de sécurité nationale et des liens supposés entre ces sociétés et Pékin. La situation est d'autant plus notable que Cramer est un défenseur habituel de Nvidia, au point d'avoir donné le prénom « Nvidia » à son propre chien. Ce désaccord dépasse la simple querelle médiatique : il touche directement à la manière dont les entreprises américaines vont choisir leurs outils d'IA dans les prochains mois. Si les modèles chinois open source comme Kimi K3 s'imposent par leur rapport performance-prix, cela pourrait accélérer leur adoption dans l'industrie, y compris aux États-Unis, malgré les réticences politiques. À l'inverse, une méfiance généralisée motivée par des considérations géopolitiques pourrait freiner cette diffusion et pousser les entreprises à privilégier des solutions plus coûteuses mais jugées plus sûres. Pour Nvidia, l'enjeu est particulièrement stratégique : Jensen Huang affirme que des modèles plus performants et moins chers, qu'ils soient chinois ou non, stimulent l'ensemble de l'écosystème en augmentant les besoins en puissance de calcul, en centres de données et en puces, donc en clients pour Nvidia lui-même. Ce clash s'inscrit dans un climat de suspicion déjà installé depuis l'irruption de DeepSeek, un autre laboratoire chinois qui fait l'objet de soupçons plus sérieux aux États-Unis, certains élus américains souhaitant même le classer comme entreprise militaire chinoise. Moonshot AI, la société derrière Kimi K3, compte effectivement des investisseurs proches de l'État chinois, mais aucune preuve publique ne démontre de lien direct avec l'armée. Jensen Huang défend l'idée que les modèles open source, précisément parce qu'ils sont ouverts, sont plus faciles à auditer et à contrôler par les entreprises qui les déploient, ce qui limiterait les risques de porte dérobée vers le gouvernement chinois. Cette controverse illustre une fracture plus large dans la Silicon Valley entre une vision favorable à l'ouverture et à la concurrence mondiale des technologies d'IA, et une autre qui privilégie la protection de la domination américaine face à la montée en puissance des acteurs chinois, un débat appelé à s'intensifier à mesure que de nouveaux modèles chinois performants continueront d'émerger.

1 source
L'article valide des benchmarks de service LLM distribué avec NVIDIA srt-slurm, des recettes SLURM, des balayages de paramètres et une analyse de Pareto
202MarkTechPost 

L'article valide des benchmarks de service LLM distribué avec NVIDIA srt-slurm, des recettes SLURM, des balayages de paramètres et une analyse de Pareto

Voici la traduction/résumé en français, sans titres ni tirets cadratins. NVIDIA a publié srt-slurm, un framework open source qui permet de transformer des configurations YAML déclaratives en workflows SLURM reproductibles pour le déploiement de grands modèles de langage distribués. L'outil en ligne de commande, srtctl, orchestre l'ensemble du processus : génération de scripts sbatch, gestion des recettes de benchmark prêtes à l'emploi, et interaction avec une API Python typée. Un tutoriel récent montre comment installer le projet directement dans Google Colab, en clonant le dépôt GitHub et en l'exécutant en mode éditable, avant d'explorer son architecture interne organisée en modules distincts : cli pour les commandes d'application et de simulation, core pour les schémas de configuration et la génération SLURM, backends pour les adaptateurs de moteurs d'inférence comme SGLang, TensorRT-LLM et vLLM, et analysis pour un tableau de bord Streamlit dédié à l'analyse des résultats. Le tutoriel détaille ensuite la création d'un fichier de configuration de cluster définissant les comptes, partitions, limites de temps, conteneurs et chemins de modèles, avant de modéliser un déploiement dissocié de type prefill-and-decode pour DeepSeek-R1, l'un des modèles de raisonnement open source les plus utilisés actuellement. Cette démarche répond à un besoin concret des équipes qui déploient des modèles de langage à grande échelle sur des clusters GPU : pouvoir valider et affiner leurs configurations de benchmark avant de les soumettre à une infrastructure de production coûteuse à mobiliser. En permettant de générer des balayages de paramètres (parameter sweeps), de valider les configurations étendues et d'analyser les résultats simulés via une analyse de frontière de Pareto opposant débit et latence, srt-slurm réduit le risque d'erreurs coûteuses lors du passage à l'échelle réelle. Pour les équipes MLOps et les fournisseurs de cloud GPU, cela représente un gain de temps significatif dans l'optimisation des déploiements d'inférence distribuée, un enjeu central alors que les coûts de calcul liés aux modèles de raisonnement comme DeepSeek-R1 continuent d'augmenter. Ce projet s'inscrit dans la tendance plus large de NVIDIA à outiller l'écosystème de l'inférence distribuée, aux côtés de son framework Dynamo pour le routage de requêtes entre nœuds. Le choix de Google Colab comme environnement de démonstration est révélateur : bien que Colab ne dispose pas d'un véritable environnement SLURM, il sert d'espace de développement pratique pour comprendre et préparer des recettes de benchmark de qualité production. Cette approche pourrait faciliter l'adoption de srt-slurm par des équipes ne disposant pas encore d'un accès direct à un cluster SLURM, en abaissant la barrière à l'entrée avant un déploiement réel sur des GPU comme les gammes H100, B200 ou GB200 de NVIDIA.

OutilsOutil
1 source
10 plateformes IA open source sans code pour créer des applications LLM, des systèmes RAG et des agents IA
203MarkTechPost 

10 plateformes IA open source sans code pour créer des applications LLM, des systèmes RAG et des agents IA

Un nouveau panorama recense dix plateformes open source qui permettent de construire des applications LLM, des systèmes RAG et des agents IA sans écrire de code d'orchestration à la main. Parmi les projets phares figure AutoAgent, développé par le Data Intelligence Lab de l'Université de Hong Kong, disponible sous licence MIT et documenté dans un article arXiv (2502.05957). Il suffit de décrire un objectif en langage naturel pour que le système génère lui-même outils, agents et flux de travail multi-agents, via un éditeur d'agents, un éditeur de workflows et un mode assistant de recherche prêt à l'emploi, compatible avec DeepSeek, Grok ou Gemini et déployable via Docker. Autre projet cité, AnythingLLM de Mintplex Labs, soutenu par Y Combinator, propose une plateforme tout-en-un auto-hébergée pour le RAG, les agents et le dialogue documentaire, sous forme d'application de bureau ou de conteneur Docker, avec plus de 30 fournisseurs de LLM compatibles et plusieurs bases vectorielles, le tout sous licence MIT. LangChain a de son côté lancé l'Open Agent Platform (OAP), une interface web sans code pour créer et gérer des agents LangGraph, avec authentification intégrée via Supabase par défaut et connexion aux serveurs MCP. Enfin, Sim Studio, sous licence Apache 2.0 et également soutenu par YC, mise sur un canevas visuel façon Figma où l'on assemble des blocs (Start, Agent, Function, API, Router, Loop) pour composer des pipelines, avec un copilote IA et une compatibilité annoncée avec plus de 1 000 outils. Cette vague d'outils change concrètement la façon dont les équipes techniques et non techniques abordent le développement d'applications d'intelligence artificielle. Là où la construction d'un agent ou d'un système de recherche augmentée nécessitait auparavant des compétences en ingénierie logicielle et l'assemblage manuel de bibliothèques d'orchestration, ces plateformes permettent de prototyper en quelques minutes via des interfaces visuelles ou de simples instructions en anglais courant. L'auto-hébergement, revendiqué par la plupart de ces projets, répond aussi à une préoccupation croissante des entreprises et administrations sur la souveraineté des données, en évitant de faire transiter des documents sensibles par des services tiers hébergés dans le cloud. Les licences permissives, MIT ou Apache 2.0, facilitent en outre l'usage commercial et les déploiements multi-clients sans contrainte juridique lourde. Ce mouvement s'inscrit dans la maturation rapide de l'écosystème des agents IA depuis 2024, où la démocratisation des outils suit celle des modèles eux-mêmes. Des acteurs comme LangChain, déjà installés dans l'écosystème des développeurs, ajoutent désormais une couche graphique à leurs frameworks existants, tandis que des startups plus jeunes soutenues par Y Combinator, comme Sim ou AnythingLLM, misent sur la simplicité d'usage pour capter des utilisateurs non spécialistes. La suite logique de cette tendance serait une consolidation autour de standards communs comme le protocole MCP, déjà adopté par plusieurs de ces plateformes, afin d'assurer l'interopérabilité entre agents et outils tiers.

UEL'auto-hébergement de ces plateformes peut intéresser les entreprises et administrations françaises soucieuses de souveraineté des données, sans impact réglementaire direct.

💬 Faut avouer que c'est du bon, cette vague de plateformes no-code pour agents. Bon, sur le papier ça a l'air magique, mais le vrai apport c'est ailleurs : l'auto-hébergement en MIT ou Apache 2.0 fait plus pour la souveraineté des données des boîtes françaises que n'importe quelle annonce de commissaire européen. Reste à voir si ces éditeurs visuels tiennent en prod face à un vrai volume d'utilisateurs, parce qu'un canevas façon Figma qui plante à 500 requêtes/minute, ça reste un prototype.

OutilsOutil
1 source
Performance par watt : la métrique clé pour l'efficacité des infrastructures d'IA
204NVIDIA AI Blog 

Performance par watt : la métrique clé pour l'efficacité des infrastructures d'IA

Le journal d'électricité disponible détermine désormais combien de tokens une "AI factory" peut générer, et donc son chiffre d'affaires et sa rentabilité. NVIDIA défend l'idée que la performance par watt, une métrique qui ne peut être trafiquée mais seulement gagnée par des résultats réels, devient la mesure de référence pour l'infrastructure IA. Pratiquement tous les modèles de pointe reposent aujourd'hui sur une architecture "mixture-of-experts" (MoE), ce qui exige une conception conjointe de toutes les couches matérielles et logicielles pour servir ces modèles à l'échelle d'un rack. La plateforme Blackwell NVL72 de NVIDIA constitue cette base, avant que la future plateforme Vera Rubin ne la prolonge. Sur les modèles ouverts les plus récents, les systèmes GB300 NVL72 affichent jusqu'à 25 fois plus de performance par watt que la génération Hopper sur DeepSeek V4 Pro, 20 fois sur GLM5.1, et 10 fois sur Kimi K2.6, un modèle conçu pour les tâches agentiques de longue durée, selon les données de SemiAnalysis InferenceX. NVIDIA précise que ces chiffres évoluent encore et publie des courbes de Pareto par modèle plutôt qu'un score unique, avec un outil nommé DynoSim permettant aux équipes de trouver leur point d'équilibre optimal entre latence, débit et coût avant de mobiliser la moindre heure de calcul GPU pour validation. Cette efficacité résulte d'une conception intégrée entre silicium et logiciel. Le commutateur NVLink, désormais dans sa sixième génération avec Vera Rubin, est pensé spécifiquement pour les charges de travail IA, avec des fonctions comme SHARP qui déportent des calculs directement dans le réseau plutôt que sur les GPU. La pile logicielle d'inférence, incluant Dynamo, TensorRT LLM, SGLang et vLLM, combine quantification NVFP4, service désagrégé, parallélisme d'experts à grande échelle et gestion du cache KV. Ces optimisations logicielles continuent de progresser dans le temps : sur DeepSeek V4, la performance par watt s'est améliorée jusqu'à 5 fois en un seul mois, sans changement matériel. L'enjeu dépasse la seule puce : dans les data centers IA actuels, les pertes liées au refroidissement et à l'inefficacité des racks font qu'environ 60% seulement de l'électricité tirée du réseau se transforme en calcul utile. Pour combler cet écart, NVIDIA propose DSX MaxLPS, le logiciel de gestion énergétique de sa plateforme DSX, qui répartit la puissance entre GPU et racks en temps réel et s'appuie sur le refroidissement liquide à eau tiède. L'enjeu, dans un monde où la disponibilité électrique devient la contrainte principale de l'IA, est de déterminer quelles entreprises pourront continuer à faire croître leurs capacités de calcul face à la demande croissante générée par l'IA agentique, et lesquelles se heurteront à un plafond énergétique. Cette course à l'efficacité oppose directement NVIDIA à ses concurrents sur le terrain du coût par token généré, un indicateur qui devient central dans les décisions d'investissement des opérateurs de centres de données à travers le monde.

UELes data centers européens, confrontés aux mêmes contraintes de disponibilité électrique, pourraient bénéficier de ces gains d'efficacité énergétique pour réduire coûts et empreinte carbone, mais aucune entreprise ni réglementation française ou européenne n'est directement concernée.

💬 Cette histoire de watts qui déterminent le chiffre d'affaires, c'est le vrai sujet caché derrière tout le bruit sur les GPU. NVIDIA a raison sur un point : quand 40% de l'électricité part en pertes de refroidissement avant même d'atteindre le calcul utile, la course n'est plus au nombre de puces mais à ce qu'on en tire. Retenez cette phrase : la contrainte électrique va bientôt trier les opérateurs de data centers en deux camps, ceux qui scalent et ceux qui plafonnent, et ce sera un critère d'investissement avant d'être un critère technique.

InfrastructureActu
1 source
Le fil autonome des agents pour VideoAgent : analyse d'intention, planification par graphe et routage d'outils pour le montage vidéo
205MarkTechPost 

Le fil autonome des agents pour VideoAgent : analyse d'intention, planification par graphe et routage d'outils pour le montage vidéo

Voici un article de type MarkTechPost décrivant un tutoriel de construction d'un système multi-agents pour l'édition vidéo automatisée. Je le résume selon vos consignes. Un tutoriel technique publié récemment détaille la reconstruction complète d'un système multi-agents inspiré de VideoAgent, conçu pour comprendre, indexer, éditer et remonter des vidéos à partir d'instructions en langage naturel. L'architecture repose sur plusieurs modules assemblés en pipeline: un parseur d'intentions qui interprète les requêtes de l'utilisateur, une bibliothèque d'agents spécialisés, un routeur d'outils, un planificateur sous forme de graphe d'exécution, et un optimiseur dit "à gradient textuel" capable de détecter et réparer automatiquement les dépendances manquantes dans ce graphe. Ces composants pilotent des outils concrets de traitement vidéo: FFmpeg pour le montage, la transcription par Whisper, la détection de scènes, l'échantillonnage d'images clés, le sous-titrage automatique, l'indexation cross-modale, la recherche par similarité, le découpage de séquences et le montage synchronisé sur le rythme musical. Le système peut fonctionner sans clé API grâce à une couche d'abstraction (classe LLM) compatible avec plusieurs fournisseurs, dont OpenAI, DeepSeek, Anthropic et Google Gemini, avec des modèles par défaut comme gpt-4o-mini ou claude-3-5-sonnet-latest. La configuration prévoit notamment quatre "prises" maximum par tâche (maxshots) et quatre cycles d'optimisation (optrounds), avec quatre scénarios de démonstration: réponse à des questions sur une vidéo, génération de résumé, production d'un aperçu façon reportage d'actualité et montage synchronisé. L'intérêt de cette démarche dépasse le simple exercice pédagogique: elle offre aux développeurs et chercheurs un modèle reproductible pour construire des agents IA capables de raisonner sur du contenu vidéo de bout en bout, sans dépendre d'un service cloud propriétaire unique. Pour les créateurs de contenu, les rédactions ou les équipes marketing, ce type de système pourrait automatiser des tâches aujourd'hui chronophages comme le dérushage, la génération de résumés vidéo ou le montage calé sur la musique, réduisant le temps de production tout en conservant un contrôle par instructions textuelles simples. Ce projet s'inscrit dans une tendance plus large de l'IA appliquée à la vidéo, où les architectures multi-agents et les graphes de planification remplacent progressivement les pipelines rigides à étape unique. La capacité à réparer automatiquement un graphe d'exécution incomplet, via l'optimisation par gradient textuel, illustre une recherche active sur la robustesse des systèmes agentiques face à des instructions ambiguës. Combiné à des briques désormais matures comme Whisper pour la transcription ou les modèles d'embeddings pour la recherche cross-modale, ce type d'architecture ouvre la voie à des outils d'édition vidéo pilotés entièrement par le langage naturel, accessibles à des équipes ne disposant pas de compétences en montage traditionnel.

OutilsTuto
1 source
Zhipu : après le succès de son IA GLM, le laboratoire chinois préparerait sa propre puce IA
206Le Big Data 

Zhipu : après le succès de son IA GLM, le laboratoire chinois préparerait sa propre puce IA

Zhipu, le laboratoire chinois derrière le modèle GLM, envisagerait de développer sa propre puce IA, selon des informations rapportées par The Information. Le projet en serait au stade des discussions préliminaires : l'entreprise aurait entamé des échanges avec plusieurs concepteurs chinois de semi-conducteurs, sans qu'aucun partenaire n'ait été retenu à ce jour. L'objectif viserait la conception d'un processeur ASIC, un circuit spécialisé et non un GPU polyvalent, taillé sur mesure pour faire fonctionner les modèles GLM. Le calendrier resterait long : plus de deux ans seraient nécessaires pour constituer une équipe dédiée, concevoir la puce, la tester, puis adapter l'ensemble de la couche logicielle qui l'exploite. Cette réflexion intervient alors que le dernier modèle de Zhipu, GLM-5.2, connaît une adoption fulgurante, avec un volume quotidien de tokens traités multiplié par 27 en une seule semaine après son déploiement sur la plateforme Vercel. Cette accélération soudaine change la donne pour Zhipu. Une demande de calcul qui explose implique des besoins en puissance considérablement accrus, dans un contexte où les laboratoires chinois doivent composer avec les restrictions américaines sur l'exportation des GPU Nvidia les plus avancés. Concevoir sa propre puce ne relèverait donc plus d'un simple choix stratégique mais d'une nécessité pour sécuriser l'accès au calcul et réduire une dépendance technologique jugée risquée. Un ASIC, conçu spécifiquement pour les modèles GLM, promettrait en théorie une meilleure efficacité énergétique et un coût d'inférence réduit une fois les modèles stabilisés, un enjeu direct pour la rentabilité de Zhipu à mesure que son usage se généralise auprès des développeurs et des entreprises. Cette démarche s'inscrit dans un mouvement plus large de course à l'indépendance matérielle dans l'IA. Google, OpenAI, ByteDance et Alibaba ont déjà développé leurs propres puces pour limiter leur dépendance aux fournisseurs externes, OpenAI ayant récemment dévoilé la sienne. BYD a de son côté conçu une puce autonome maison, et Reuters a récemment révélé que DeepSeek explorerait également des puces personnalisées afin de réduire sa dépendance envers Huawei et Nvidia. Zhipu ne ferait donc que suivre une tendance déjà bien engagée chez les géants technologiques, chinois comme américains. Reste à savoir si l'entreprise parviendra à transformer ce projet encore embryonnaire en réalité industrielle, dans un secteur des semi-conducteurs où deux années peuvent suffire à rebattre entièrement les cartes du marché.

InfrastructureActu
1 source
La domination de GPT-4 a duré un an, alors que les modèles les plus performants d'aujourd'hui tiennent à peine sept semaines au sommet
207The Decoder 

La domination de GPT-4 a duré un an, alors que les modèles les plus performants d'aujourd'hui tiennent à peine sept semaines au sommet

Pendant environ un an, GPT-4 d'OpenAI a occupé la première place de l'Epoch Capabilities Index, un classement qui mesure les capacités des modèles d'intelligence artificielle. Cette domination reste, à ce jour, la plus longue jamais enregistrée par un modèle sur ce classement. Depuis que Claude 3 Opus d'Anthropic a pris la tête en février 2024, la situation a radicalement changé : le leadership a changé de mains 17 fois en un peu plus de deux ans, avec une durée médiane de règne d'à peine sept semaines par modèle. Ce basculement traduit une transformation profonde du secteur. La course entre OpenAI, Anthropic, Google, Meta et les acteurs chinois comme DeepSeek s'est intensifiée au point que plus aucun laboratoire ne parvient à conserver un avantage durable. Pour les entreprises et développeurs qui construisent des produits sur ces modèles, cela signifie une instabilité technologique constante : le meilleur outil aujourd'hui peut être dépassé dans quelques semaines, ce qui complique les choix d'investissement à long terme et encourage une architecture logicielle capable de changer de modèle facilement. Paradoxalement, cette accélération apparente cache un ralentissement des progrès réels. Les écarts de performance entre les modèles qui se succèdent en tête du classement se réduisent d'une génération à l'autre, signe que les gains de capacités s'amenuisent à mesure que les modèles s'approchent de certaines limites techniques. Cette tendance interroge sur la suite de la course à l'IA générative : les laboratoires devront-ils changer d'approche, au-delà du simple agrandissement des modèles, pour continuer à progresser significativement ?

LLMsPaper
1 source
Sakana AI lance Sakana Translate, un outil de traduction japonais-anglais-chinois propulsé par Namazu, avec modes traduction, relecture et question
208MarkTechPost 

Sakana AI lance Sakana Translate, un outil de traduction japonais-anglais-chinois propulsé par Namazu, avec modes traduction, relecture et question

Sakana AI, le laboratoire de recherche tokyoïte fondé en 2023 par David Ha et Llion Jones, a lancé Sakana Translate, une nouvelle fonctionnalité intégrée à son service de chat Sakana Chat. Cet outil gratuit assure la traduction bidirectionnelle entre le japonais, l'anglais et le chinois, et repose sur Namazu, la série de modèles adaptés au japonais par Sakana AI et annoncée pour la première fois le 24 mars 2026. Namazu n'est pas entraîné depuis zéro : il applique un post-entraînement à des modèles open-weight existants, dont DeepSeek-V3.1-Terminus, Llama 3.1 405B et gpt-oss-120B, une méthode moins coûteuse qu'un entraînement complet et permettant d'adapter finement ces modèles à la langue et à la culture japonaises. Sakana Translate se présente comme une application web unique regroupant trois modes accessibles avec un seul compte : Translate, qui convertit jusqu'à environ 5 000 caractères japonais avec un affichage progressif du texte et un historique sauvegardé automatiquement ; Proofread, qui corrige un brouillon en ajustant le ton, la politesse et le niveau de formalité, avec les changements signalés par surlignage façon diff ; et Ask, qui permet de poser des questions de suivi sur une traduction pour en comprendre les nuances grammaticales ou stylistiques. L'enjeu affiché par Sakana AI dépasse la simple conversion mot à mot : l'entreprise vise ce qu'elle appelle une "traduction profonde pour le Japon", capable de restituer le contexte, le ton et le registre social, des éléments souvent perdus par les outils de traduction généralistes. Les exemples cités incluent les formules de politesse professionnelles japonaises, les concepts culturellement spécifiques, les abréviations et l'argot internet, autant de nuances qu'une traduction grammaticalement correcte peut manquer sans un travail d'adaptation dédié. Pour les utilisateurs professionnels, notamment dans la rédaction d'emails ou de documents d'entreprise, cela représente un gain concret : le mode Proofread cible spécifiquement les usages où le registre de langue compte autant que la correction grammaticale. Le mode Ask, de son côté, supprime le besoin de basculer entre un traducteur et un dictionnaire, en répondant aux questions de nuance directement dans le contexte de la traduction produite. Sur le plan des performances, l'équipe de Sakana AI a évalué la qualité de traduction avec XCOMET-XL, un métrique neuronal d'environ 3,5 milliards de paramètres développé par Unbabel qui note les traductions sur une échelle de 0 à 1 tout en signalant les erreurs précises, appliqué aux données du WMT 2024 General Translation, une tâche de référence issue de la Conference on Machine Translation couvrant plusieurs domaines et paires de langues. Selon les résultats rapportés, Sakana Translate obtient un score proche des modèles les plus performants du marché, ce que l'entreprise qualifie de qualité compétitive pour un moteur de traduction. Ce lancement s'inscrit dans la stratégie plus large de Sakana AI autour de Namazu, qui vise à adapter des modèles de fondation existants aux spécificités linguistiques et culturelles japonaises plutôt que d'entraîner de nouveaux modèles à partir de zéro, une approche que le laboratoire pourrait étendre à d'autres cas d'usage à l'avenir.

💬 Post-entraîner des modèles existants plutôt que d'entraîner depuis zéro, c'est le vrai move ici. Sakana montre qu'on peut battre les traducteurs généralistes sur les nuances culturelles sans les moyens d'un labo à dix milliards. Reste que c'est verrouillé sur le japonais, l'anglais et le chinois : si tu bosses en français, tu regardes le train passer.

OutilsOutil
1 source
Synthetic Sciences lance OpenScience, un atelier IA open source et agnostique pour la recherche en machine learning, biologie, physique et chimie
209MarkTechPost 

Synthetic Sciences lance OpenScience, un atelier IA open source et agnostique pour la recherche en machine learning, biologie, physique et chimie

Synthetic Sciences a dévoilé OpenScience, un espace de travail IA open source destiné à la recherche scientifique, disponible sous licence Apache 2.0 et déployable sur sa propre infrastructure. L'équipe présente ce projet comme une alternative ouverte à Claude Science, l'outil lancé par Anthropic fin juin 2026, tout en précisant qu'il s'agit d'un projet indépendant, non affilié à l'entreprise. OpenScience s'installe via npm avec la commande openscience, ou directement en une étape avec npx synsci, sans nécessiter de compte pour démarrer. L'outil est agnostique vis-à-vis des modèles : il fonctionne avec Claude, GPT, Gemini, GLM, Kimi, DeepSeek ou des modèles open-weight affinés localement, chacun utilisable via ses propres clés API et interchangeable à chaque requête depuis un sélecteur intégré à l'interface. Il embarque plus de 250 compétences modifiables couvrant l'entraînement de modèles (DeepSpeed, PEFT, TRL), l'évaluation, la chimie computationnelle ou la biologie moléculaire et clinique, ainsi qu'un accès direct à une trentaine de bases de données scientifiques comme UniProt, PDB, ChEMBL, arXiv, OpenAlex ou Semantic Scholar, exploitées comme outils par l'agent. L'enjeu affiché par Synthetic Sciences est de ne pas laisser les outils d'IA scientifique dépendre d'un seul fournisseur. En gardant le flux de travail ouvert, les modèles interchangeables et les données locales, OpenScience s'adresse aux laboratoires, équipes de recherche et développeurs qui veulent garder le contrôle sur leurs clés, leurs coûts et leurs résultats plutôt que de dépendre d'une plateforme propriétaire. Concrètement, l'outil automatise l'ensemble du cycle de recherche : lecture de la littérature scientifique, formulation d'hypothèses, écriture et exécution de code, conduite d'expériences, analyse des résultats et rédaction, le tout dans une seule session continue affichée dans le navigateur. Cette approche pourrait accélérer des tâches habituellement fragmentées entre plusieurs outils, tout en évitant le verrouillage propriétaire qui inquiète une partie de la communauté scientifique et technique face à la montée des assistants IA spécialisés. Le lancement s'inscrit directement dans le sillage de Claude Science, présenté par Anthropic fin juin 2026 comme un outil de recherche assistée par IA. OpenScience reprend une architecture similaire, avec un serveur local hébergeant l'interface, le moteur d'agents et la couche d'outils, mais mise sur l'ouverture totale du code et l'absence de dépendance à un fournisseur unique. Le projet propose également une option payante facultative baptisée Atlas, qui donne accès à un ensemble de modèles de pointe sélectionnés, facturés depuis un portefeuille prépayé, ainsi qu'à un graphe de recherche persistant et à du calcul cloud, mais cette couche reste entièrement optionnelle. L'extensibilité est un axe central du projet, avec la prise en charge de serveurs MCP, de l'intégration LSP, de plugins et d'agents personnalisés, complétée par un kit de développement TypeScript, ce qui laisse présager une intégration croissante de ce type d'outils dans les workflows de recherche scientifique au cours des prochains mois.

💬 Enfin quelqu'un qui répond à Claude Science par du code plutôt que par un communiqué. Sur le papier, 250 compétences et un agnosticisme total sur les modèles, ça a de la gueule, mais le vrai test c'est si un labo arrive à le faire tourner sans un ingénieur dédié à plein temps derrière. Selon Le Fil IA, l'open source devient la vraie réponse concurrentielle aux outils propriétaires d'Anthropic et OpenAI, pas les discours sur l'éthique.

OutilsOutil
1 source
L'ancien responsable de Qwen explique les erreurs du hybrid thinking et pourquoi il mise desormais sur les agents
210MarkTechPost 

L'ancien responsable de Qwen explique les erreurs du hybrid thinking et pourquoi il mise desormais sur les agents

Junyang Lin, qui dirigeait le projet Qwen chez Alibaba, a annoncé son départ le 3 mars 2026 et se présente désormais comme chercheur indépendant. Dans une conférence intitulée "Qwen : vers un modèle ou agent généraliste", il retrace toute la famille Qwen, de QwQ-32B à Qwen2.5-Max, en passant par Qwen3, Qwen2.5-VL et Qwen2.5-Omni, en comparant leurs performances à celles de DeepSeek-R1, Grok 3 Beta, Gemini 2.5 Pro et la série o d'OpenAI. Qwen3 occupe la place centrale de l'exposé : Lin y détaille les modes de raisonnement hybrides, avec un mode "réflexion" pour le raisonnement pas à pas et un mode "instruction" pour des réponses quasi instantanées, ainsi que des budgets de réflexion ajustables par l'utilisateur. La famille couvre désormais 119 langues et dialectes contre 29 auparavant, avec des tailles allant de 0,6 à 235 milliards de paramètres, disponibles en versions quantifiées GGUF, GPTQ, AWQ et MLX, toutes sous licence Apache 2.0. Les architectures présentées montrent que les petits modèles denses partagent leurs embeddings d'entrée et de sortie avec un contexte de 32 000 tokens, tandis que les modèles plus grands, denses ou à mélange d'experts, abandonnent ce partage et étendent le contexte à 128 000 tokens. Ce que Lin détaille surtout, c'est la difficulté technique derrière cette fusion des modes de réflexion, un enjeu qui dépasse largement Qwen. Un modèle optimisé pour l'instruction est récompensé pour sa rapidité et sa concision, tandis qu'un modèle de raisonnement est récompensé pour le temps qu'il consacre aux problèmes complexes. Fusionner les deux sans précaution dégrade les deux comportements à la fois. Qwen3 a d'abord tenté cette fusion via un pipeline de post-entraînement en quatre étapes, avant que la lignée 2507, plus tard en 2025, ne revienne à des variantes séparées, une pour l'instruction et une pour le raisonnement. Lin y voit avant tout un problème de données plutôt que d'architecture, et cite en contrepoint la trajectoire d'Anthropic, qui a conservé une approche hybride avec Claude 3.7 Sonnet et son budget de réflexion réglable, puis avec Claude 4 qui entrelace raisonnement et usage d'outils pour le code et les tâches longues. Cette réflexion s'inscrit dans un basculement plus large que Lin situe entre deux époques. La première, portée par o1 et DeepSeek-R1, a établi que l'apprentissage par renforcement exige des récompenses vérifiables, plaçant les mathématiques, le code et la logique au centre des efforts. La seconde, qu'il appelle la pensée agentique, consiste à raisonner pour agir : planifier, décider quand utiliser un outil, lire les retours de l'environnement et ajuster sa trajectoire. Ses pistes pour la suite incluent davantage de pré-entraînement, du renforcement fondé sur des retours d'environnement, des contextes plus longs et davantage de modalités, résumées dans sa formule finale : entraîner des agents plutôt que de simples modèles.

💬 L'aveu est rare : le mec qui a dirigé Qwen pendant deux ans dit texto que fusionner mode rapide et mode raisonnement, ça marche pas encore proprement, et qu'ils sont revenus en arrière avec la lignée 2507. Ce que ça révèle, c'est que le hybrid thinking vendu partout comme la norme (Claude, et bientôt tout le monde) reste un problème de données non résolu, pas une simple question d'architecture qu'on règle avec plus de compute. Et son pivot vers "entraîner des agents plutôt que des modèles" confirme un truc que je sens depuis des mois : la course au meilleur benchmark de raisonnement pur touche à sa fin.

LLMsPaper
1 source
GeneBench-Pro : OpenAI crée un benchmark si difficile que même GPT 5.6 Sol galère
211Le Big Data 

GeneBench-Pro : OpenAI crée un benchmark si difficile que même GPT 5.6 Sol galère

OpenAI a dévoilé le 30 juin 2026 GeneBench-Pro, un nouveau benchmark destiné à mesurer une compétence bien plus exigeante que la simple restitution de connaissances : le jugement scientifique des modèles d'intelligence artificielle. L'outil rassemble 129 problèmes couvrant la génomique, la biologie quantitative et la médecine translationnelle. Pour chaque exercice, l'IA reçoit un jeu de données réel, le contexte d'une expérience et une question précise, et doit explorer les données, choisir la méthode d'analyse adaptée, puis formuler une conclusion pertinente, exactement comme le ferait un chercheur face à un problème inédit. Avant la publication, OpenAI a fait valider 82 des 129 problèmes par des experts indépendants (doctorants, chercheurs postdoctoraux, scientifiques de l'industrie et professeurs), afin de vérifier le réalisme des scénarios et la cohérence des réponses attendues. Selon Alexander Strudwick Young, la plupart de ces exercices auraient mis en difficulté un doctorant livré à lui-même, sans l'appui d'un superviseur expérimenté. Sur ce test, GPT-5.6 Sol domine largement ses prédécesseurs avec 28,7 % de réussite en niveau de raisonnement maximal, et 31,5 % en mode Pro, contre moins de 5 % pour GPT-5 lors des premiers essais sur la version originale de GeneBench. Cette progression illustre un enjeu concret pour la recherche biomédicale : les experts estiment qu'un problème type de GeneBench-Pro demanderait entre 20 et 40 heures de travail à un spécialiste humain, facturées environ 200 dollars de l'heure, soit plusieurs milliers de dollars par exercice résolu. Une IA capable d'atteindre un niveau de compétence comparable pourrait effectuer le même travail pour seulement quelques dollars de coût d'inférence. L'écart de performance entre modèles reste toutefois considérable : Opus 4.8 plafonne à 16 %, Gemini 3.5 Flash à 8,1 %, Gemini 3.1 Pro à 3,1 %, GLM 5.2 à 4,6 %, DeepSeek V4 Pro à 2,4 % et Grok 4.3 à seulement 1,5 %. Ces résultats montrent qu'au-delà du simple niveau de raisonnement affiché, la capacité à naviguer dans des données biologiques désordonnées et à faire des choix méthodologiques justes reste un obstacle majeur pour la plupart des modèles, y compris les plus récents. Ce benchmark s'inscrit dans une tendance plus large de l'industrie de l'IA, qui cherche désormais à évaluer les modèles non plus sur des connaissances factuelles mais sur leur capacité à mener une véritable démarche scientifique, jugement, exploration et arbitrage méthodologique inclus. Tous les problèmes ont été créés de manière synthétique par OpenAI, ce qui lui permet de garder un contrôle total sur les données et de comparer précisément les réponses des modèles aux résultats attendus, tout en tenant compte du fait que plusieurs méthodes d'analyse différentes peuvent aboutir à une conclusion scientifiquement valable. Pour garantir une évaluation indépendante, OpenAI publie en open source dix problèmes représentatifs sur Hugging Face, et confie un second ensemble de 50 questions à Artificial Analysis, qui mènera ses propres évaluations comparatives des différents modèles d'IA. À terme, cet effort vise à mesurer si les agents d'intelligence artificielle peuvent réellement accélérer la recherche en biologie computationnelle, un domaine où la rareté des experts qualifiés et le coût élevé de leur temps constituent un frein important à l'innovation.

UECe benchmark pourrait aider les laboratoires de recherche biomédicale européens à évaluer si l'IA peut accélérer leurs travaux, mais n'implique directement aucune entreprise ou institution française ou européenne.

RecherchePaper
1 source
« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »
212AWS ML Blog 

« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »

Les organisations qui exploitent des dizaines, voire des centaines de comptes AWS font face à un dilemme récurrent pour l'accès aux modèles d'intelligence artificielle sur Amazon Bedrock. AWS distingue trois catégories de modèles : les modèles Amazon comme Nova, les modèles vendus par Amazon tels que ceux de Meta, Mistral ou DeepSeek, accessibles immédiatement avec de simples permissions Bedrock, et les modèles tiers commercialisés via AWS Marketplace, comme Claude d'Anthropic, ceux de Cohere ou de Stability AI, qui exigent un abonnement Marketplace distinct dans chaque compte. Jusqu'ici, les équipes devaient soit accorder largement des permissions Marketplace à tous les comptes de travail, au risque de fragiliser la gouvernance, soit activer manuellement chaque abonnement compte par compte, une charge opérationnelle lourde qui ralentit l'adoption de l'IA à grande échelle. AWS présente désormais les "managed entitlements" pour Bedrock, une fonctionnalité qui permet de souscrire une seule fois depuis un compte central puis de distribuer l'accès aux modèles à travers toute l'organisation, via AWS License Manager, sans qu'aucune permission Marketplace ne soit nécessaire dans les comptes membres. Cette nouveauté change concrètement la donne pour les équipes cloud et sécurité chargées de gouverner l'usage de l'IA générative à l'échelle d'un groupe. Elle s'adresse en priorité aux organisations qui font tourner des charges de travail sur de multiples comptes AWS, qui veulent éviter de diffuser des droits Marketplace à chaque équipe, qui ont négocié des tarifs préférentiels via une offre privée et souhaitent les appliquer uniformément, ou qui ont besoin d'une visibilité centralisée sur qui accède à quels modèles. À l'inverse, les structures qui n'utilisent que des modèles Amazon ou partenaires, qui opèrent sur un compte unique, ou dont les équipes gèrent déjà leurs abonnements de façon autonome n'ont pas vraiment besoin de ce mécanisme. Le bénéfice principal réside dans la réduction du risque de mauvaise configuration et dans l'accélération du déploiement de modèles comme Claude à travers de grandes organisations, tout en gardant un contrôle centralisé. Sur le plan technique, la mise en place suppose qu'AWS Organizations soit configuré avec toutes les fonctionnalités activées, qu'un accès au compte de gestion soit disponible avec les permissions AWS Marketplace et AWS License Manager, et que des rôles liés aux services (service-linked roles) soient créés pour ces deux services. Le concept central repose sur deux notions : la licence, qui représente le droit de l'organisation à utiliser un modèle donné, et les attributions ("grants"), le mécanisme par lequel ce droit est partagé avec des comptes spécifiques. Cette approche s'inscrit dans la suite logique d'autres outils Bedrock comme l'évaluation de modèles ou les garde-fous (guardrails), qui visent tous à concilier autonomie des équipes et gouvernance centralisée des déploiements d'IA en entreprise.

InfrastructureActu
1 source
Créer un agent IA style nanobot dans Google Colab : appel d'outils, mémoire de session, compétences et serveurs MCP
213MarkTechPost 

Créer un agent IA style nanobot dans Google Colab : appel d'outils, mémoire de session, compétences et serveurs MCP

Un tutoriel publié récemment décrit comment construire de zéro un agent IA personnel dans Google Colab, en s'inspirant de l'architecture de Nanobot, un framework d'agents léger. Le projet reconstruit brique par brique les composants fondamentaux d'un agent moderne : abstraction du fournisseur LLM, enregistrement d'outils (tool calling), mémoire de session, hooks de cycle de vie, compétences modulaires (skills) et un serveur d'outils au format MCP (Model Context Protocol). L'intégralité du code tourne dans un notebook Colab, sans clé API obligatoire grâce à un fournisseur simulé (MockProvider) qui reproduit le comportement d'un vrai modèle de langage de façon déterministe, permettant d'observer la boucle agentique en fonctionnement réel sans dépense ni connexion réseau. L'intérêt pédagogique est considérable pour les développeurs qui veulent comprendre ce qui se passe réellement sous le capot des frameworks populaires comme LangChain ou LlamaIndex. Au lieu d'utiliser une boîte noire externe, ce tutoriel expose comment les messages, les appels d'outils, les résultats et les réponses du modèle s'articulent dans une boucle d'inférence concrète. Le fait de pouvoir s'y connecter à n'importe quel fournisseur compatible OpenAI (OpenRouter, DeepSeek, Together AI, vLLM, LM Studio, Ollama) via une couche d'abstraction unique le rend immédiatement opérationnel en production. Pour les équipes qui construisent des agents internes sans vouloir dépendre d'un SDK propriétaire, ce type d'architecture minimaliste représente une alternative solide, maintenable et compréhensible. Ce tutoriel s'inscrit dans une dynamique plus large autour de la standardisation des agents IA. Le protocole MCP (Model Context Protocol), popularisé par Anthropic fin 2024, s'est imposé comme référence pour exposer des outils à un agent de façon modulaire, et de nombreux projets cherchent aujourd'hui à l'implémenter sans dépendre des SDK officiels. Nanobot lui-même est conçu pour rester léger et portable, à l'opposé des frameworks lourds qui accumulent les dépendances. La tendance va clairement vers des agents plus petits, plus explicites, plus faciles à auditer : les développeurs indépendants et les petites équipes veulent pouvoir lire et comprendre chaque ligne de la boucle d'inférence plutôt que de faire confiance à des abstractions opaques. Ce genre de ressource pédagogique, qui reconstruit l'essentiel en quelques centaines de lignes de Python pur, répond directement à ce besoin croissant de maîtrise et de transparence dans les systèmes d'IA autonomes.

OutilsTuto
1 source
GLM-5.2 : guide pratique de l'API compatible OpenAI, raisonnement, appels de fonctions et récupération longue durée
214MarkTechPost 

GLM-5.2 : guide pratique de l'API compatible OpenAI, raisonnement, appels de fonctions et récupération longue durée

Zhipu AI a mis à disposition une API hébergée pour son modèle GLM-5.2, entièrement compatible avec les clients OpenAI, permettant aux développeurs d'accéder au modèle sans avoir à l'exécuter localement. L'API est disponible via cinq fournisseurs distincts : la plateforme native z.ai, OpenRouter, Together AI, Requesty et HuggingFace, tous accessibles avec la bibliothèque Python openai standard. La tarification s'établit à 1,40 dollar par million de tokens en entrée et 4,40 dollars par million de tokens en sortie. Le modèle propose un contrôle fin du niveau de raisonnement via un paramètre reasoningeffort avec trois niveaux (désactivé, high, max), ainsi qu'un mode "thinking" qui expose la trace de raisonnement interne du modèle avant la réponse finale. Le tutoriel couvre l'ensemble du spectre fonctionnel : chat de base, raisonnement en streaming, appel de fonctions, agent à outils, sortie JSON structurée, récupération longue-contexte et estimation de coût à la volée. La compatibilité OpenAI de GLM-5.2 est sa proposition de valeur centrale : un développeur qui utilise déjà GPT-4o ou Claude via l'API d'Anthropic peut basculer vers GLM-5.2 en changeant uniquement l'URL de base et la clé API, sans réécrire son code. Le contrôle du niveau de raisonnement représente un avantage concret par rapport aux modèles qui imposent un mode de réflexion unique : les tâches simples peuvent être traitées rapidement et à moindre coût avec le mode désactivé, tandis que les problèmes complexes mobilisent la pleine capacité de raisonnement. L'exposition de la trace de pensée (reasoningcontent) dans la réponse est également utile pour le débogage ou pour construire des interfaces qui montrent le raisonnement du modèle à l'utilisateur final. GLM-5.2 s'inscrit dans la vague de modèles chinois à raisonnement avancé qui rivalisent désormais frontalement avec les offres américaines, notamment DeepSeek-R1 et Qwen de Alibaba, sur les benchmarks de raisonnement mathématique et logique. La décision de Zhipu AI de proposer une API compatible OpenAI reflète une stratégie d'adoption agressive : plutôt que de demander aux développeurs d'apprendre une nouvelle interface, le modèle s'intègre dans les outils existants. La disponibilité sur des agrégateurs comme OpenRouter et HuggingFace élargit encore l'accès, particulièrement en dehors de la Chine. À mesure que la concurrence entre fournisseurs de modèles s'intensifie, la compatibilité d'API et la transparence du raisonnement deviennent des critères de sélection aussi importants que les performances brutes sur les benchmarks.

💬 La vraie astuce de Zhipu, c'est pas le modèle lui-même, c'est la stratégie d'adoption. Un dev qui tourne sur GPT-4o ou Claude change deux lignes de code et c'est parti, sans réapprendre quoi que ce soit. On est en train de voir les modèles chinois prendre des parts de marché non pas sur les benchmarks, mais sur le confort de migration, et ça, c'est beaucoup plus redoutable que n'importe quel score MMLU.

LLMsTuto
1 source
Salesforce CodeGen : générer, valider et reclasser des fonctions Python avec tests et vérifications de sécurité
215MarkTechPost 

Salesforce CodeGen : générer, valider et reclasser des fonctions Python avec tests et vérifications de sécurité

Salesforce CodeGen est un modèle de génération de code disponible sur Hugging Face, conçu pour produire des fonctions Python à partir de descriptions en langage naturel. Un tutoriel publié récemment présente un pipeline complet autour de ce modèle, allant du chargement du modèle jusqu'à l'export d'artefacts en passant par la validation automatique et le reclassement de candidats. Le workflow s'appuie sur la bibliothèque Transformers d'Hugging Face et PyTorch, avec support GPU via CUDA. Plusieurs variantes du modèle sont proposées selon les ressources disponibles : codegen-350M-mono pour les environnements légers comme Google Colab, codegen-2B-mono pour plus de puissance, et codegen25-7b-mono pour les configurations les plus exigeantes, avec 7 milliards de paramètres. La génération s'effectue avec des paramètres calibrés, notamment une température de 0,35 et un top-p de 0,92, favorisant des sorties précises sans sacrifier toute diversité. Ce type de pipeline dépasse la simple complétion de code : il intègre des étapes de vérification syntaxique, de contrôle de sécurité statique, et de validation par tests unitaires automatisés. L'approche "best-of-N" permet de générer plusieurs candidats pour une même tâche, puis de retenir le meilleur selon des critères objectifs, ce qui améliore significativement la qualité des sorties par rapport à une génération unique. Pour les développeurs et les équipes d'ingénierie, cela représente une voie vers l'automatisation partielle de tâches répétitives, avec des garanties de qualité intégrées. La mesure de complexité cyclomatique via la bibliothèque Radon et l'analyse de tokens via Tiktoken donnent des métriques concrètes sur le code produit, utiles pour des environnements de production où la maintenabilité compte. Salesforce a lancé la famille CodeGen en 2022 comme alternative ouverte à GitHub Copilot, et les modèles sont depuis accessibles librement sur Hugging Face. La montée en puissance des modèles de code open source s'est accélérée avec l'arrivée de DeepSeek Coder, StarCoder 2 et Code Llama, tous positionnés sur le même segment. Ce tutoriel illustre comment des modèles relativement légers, à partir de 350 millions de paramètres, peuvent être intégrés dans des pipelines structurés sans dépendre d'API cloud propriétaires. L'enjeu pour les entreprises est double : réduire les coûts liés aux services comme GPT-4o ou Claude pour la génération de code, et garder le contrôle sur les données traitées. La prochaine étape logique pour ce genre de workflow serait l'intégration dans des environnements d'intégration continue, où la validation automatique de code généré pourrait s'inscrire directement dans les processus de revue.

OutilsOutil
1 source
L'Afrique du Sud dispose d'atouts en IA, mais son projet de politique ne les exploite pas
216IEEE Spectrum AI 

L'Afrique du Sud dispose d'atouts en IA, mais son projet de politique ne les exploite pas

L'Afrique du Sud détient environ 88 % des réserves mondiales de métaux du groupe du platine, des matériaux indispensables à la fabrication de semi-conducteurs et donc à l'infrastructure même de l'intelligence artificielle. Elle abrite le plus grand marché de centres de données du continent africain, évalué à 2,16 milliards de dollars en 2024. Pourtant, le projet de politique nationale sur l'IA, récemment retiré après avoir été rendu public, ne tire aucun parti de cette position stratégique exceptionnelle. Une nouvelle commission a été annoncée pour réviser ce texte, mais le mal est plus profond : aucun mécanisme de vérification n'a empêché la publication d'un document truffé de références erronées, révélant une défaillance systémique dans la façon dont les gouvernements adoptent l'IA. Le vide politique laissé par ce projet avorté se comble dans les faits par une compétition frontale entre les écosystèmes technologiques chinois et américain. Huawei propose désormais aux entreprises africaines un bundle combinant le modèle de langage DeepSeek à ses propres infrastructures cloud et stockage, à des prix inférieurs de plus de 90 % aux offres concurrentes. En face, Microsoft a annoncé un investissement de 5,4 milliards de rands (300 millions de dollars) en cloud et en IA en Afrique du Sud d'ici fin 2027, s'ajoutant à un précédent engagement de 20,4 milliards de rands. Google, AWS et Oracle disposent déjà de régions cloud dans le pays. Ces investissements ne sont pas neutres : l'infrastructure Huawei est documentée comme un vecteur d'objectifs stratégiques chinois, notamment via son réseau de surveillance Safe Cities, tandis que les hyperscalers américains imposent des modèles fermés, des tarifs fixés unilatéralement et des conditions d'accès que nul gouvernement africain n'a réellement négociées. L'ironie de la situation est saisissante : l'Afrique du Sud extrait les minerais qui rendent l'IA possible, mais se retrouve traitée dans sa propre politique comme simple consommatrice de systèmes qu'elle n'a pas façonnés. Sans politique précisant ce qu'elle exige en contrepartie de l'accès à son marché, son levier structurel reste inutilisé. C'est pourtant le seul pays en développement disposant d'un pouvoir de négociation suffisant pour obtenir des conditions réellement différentes de celles que dictent Pékin ou Silicon Valley. Si l'Afrique du Sud renonce à exercer ce rapport de force, elle offre un précédent révélateur : même une position géologique dominante ne suffit pas à imposer des termes équitables dans la gouvernance mondiale de l'IA.

UELe cas sud-africain illustre les risques de dépendance aux infrastructures IA étrangères, un enjeu que l'UE tente précisément d'adresser via l'AI Act et ses politiques de souveraineté numérique.

RégulationReglementation
1 source
Concevoir un pipeline RLVR multimodal complet : Open-MM-RL, prompting vision-langage, scoring des récompenses et export GRPO
217MarkTechPost 

Concevoir un pipeline RLVR multimodal complet : Open-MM-RL, prompting vision-langage, scoring des récompenses et export GRPO

Un tutoriel publié récemment sur Hugging Face propose un pipeline complet pour entraîner des modèles de vision-langage par apprentissage par renforcement à récompenses vérifiables (RLVR). Le travail s'appuie sur le dataset TuringEnterprises/Open-MM-RL, accessible publiquement sur la plateforme, et couvre l'intégralité du workflow : chargement des données, analyse statistique du corpus, conception d'une fonction de récompense multicritère, formatage des prompts pour les modèles multimodaux, et export final au format GRPO. Le dataset regroupe des exemples annotés répartis en plusieurs domaines (mathématiques, sciences, raisonnement visuel) avec une ou plusieurs images par exemple, des questions de longueur variable et des réponses sous formats divers, numériques, fractions, LaTeX, expressions symboliques. Le tutoriel utilise notamment SmolVLM comme modèle de test pour valider les prompts construits sur des échantillons représentatifs. L'intérêt principal de cette approche réside dans sa capacité à rendre le fine-tuning RLVR accessible sans infrastructure lourde. La fonction de récompense proposée gère cinq types de réponses différents, exact, numérique, fractionnaire, LaTeX et symbolique via sympy, ce qui permet d'évaluer automatiquement la justesse d'un modèle sur des tâches de raisonnement multimodal sans annotation humaine supplémentaire. Pour les équipes travaillant sur l'alignement ou l'amélioration de modèles vision-langage, disposer d'un tel pipeline structuré réduit considérablement le temps d'ingénierie nécessaire pour passer d'un dataset brut à une boucle d'entraînement fonctionnelle. L'export au format GRPO (Group Relative Policy Optimization) est particulièrement pertinent puisqu'il permet une intégration directe avec les frameworks d'entraînement modernes compatibles avec cette méthode. Ce tutoriel s'inscrit dans une dynamique plus large initiée fin 2024 par DeepSeek-R1, qui a popularisé le GRPO comme alternative efficace au PPO classique pour le fine-tuning par renforcement des LLMs. Depuis, la communauté open-source s'emploie à reproduire et étendre ces résultats au domaine multimodal, où les benchmarks de raisonnement visuel restent plus difficiles à évaluer automatiquement qu'en texte pur. TuringEnterprises positionne Open-MM-RL comme une ressource de référence pour combler ce manque. Les prochaines étapes logiques incluent l'entraînement effectif d'un modèle via GRPO sur ce dataset, la comparaison avec des baselines supervisées, et l'extension à des domaines visuels plus complexes comme le raisonnement spatial ou la compréhension de graphiques scientifiques.

UELes équipes de recherche et startups européennes travaillant sur les modèles vision-langage peuvent exploiter directement ce pipeline open-source hébergé sur Hugging Face pour réduire le temps d'ingénierie nécessaire au fine-tuning RLVR multimodal.

RechercheTuto
1 source
Construire des Transformers à profondeur récurrente avec OpenMythos : MLA, GQA, Sparse MoE et raisonnement itératif
218MarkTechPost 

Construire des Transformers à profondeur récurrente avec OpenMythos : MLA, GQA, Sparse MoE et raisonnement itératif

OpenMythos est une bibliothèque Python open source permettant de construire des transformers dits "recurrent-depth", une architecture hybride qui combine des blocs d'attention avancés avec une boucle récurrente contrôlée. Un tutoriel publié récemment montre comment déployer cette bibliothèque de bout en bout dans Google Colab pour entraîner deux variantes de modèles : l'une utilisant l'attention multi-latente (MLA, inspirée de DeepSeek-V2) avec cache KV compressé, l'autre utilisant l'attention par groupes de requêtes (GQA, avec moins de têtes KV que de têtes Q). Les deux variantes intègrent également un Mixture of Experts épars (4 experts au total, 2 activés par token, 1 expert partagé), avec une dimension cachée de 128, 4 têtes d'attention, et une longueur de séquence maximale de 32 tokens. Le tutoriel valide les modèles sur une tâche de raisonnement compositionnel synthétique : prédire la somme d'une chaîne de chiffres modulo 7, une tâche conçue pour forcer le modèle à enchaîner plusieurs étapes de calcul intermédiaires. Ce type d'architecture présente un avantage concret majeur : la réutilisation des paramètres via les boucles récurrentes. Là où un transformer classique empile physiquement N couches distinctes pour N niveaux de profondeur de traitement, un modèle recurrent-depth peut traverser les mêmes couches plusieurs fois (jusqu'à 8 itérations de boucle dans ce tutoriel), simulant une profondeur de calcul bien supérieure à son nombre réel de paramètres. Le tutoriel mesure notamment le rayon spectral de la matrice d'injection récurrente, un indicateur de stabilité numérique qui doit rester inférieur à 1 pour garantir que les activations ne divergent pas au fil des boucles. Cette approche ouvre la voie à des modèles capables d'allouer dynamiquement plus de "réflexion" à des problèmes complexes sans augmenter leur empreinte mémoire permanente. L'architecture s'inscrit dans un mouvement plus large de recherche sur l'efficacité computationnelle des grands modèles de langage. L'attention MLA a été popularisée par DeepSeek-V2, un modèle chinois open source qui a démontré en 2024 qu'une compression agressive du cache KV pouvait réduire les coûts d'inférence sans dégradation notable des performances. La combinaison avec un Mixture of Experts épars rappelle l'architecture de Mixtral (Mistral AI) et de ses successeurs, où seule une fraction des paramètres est activée par token. OpenMythos cherche à réunir ces techniques dans un cadre expérimental accessible, destiné aux chercheurs et ingénieurs qui souhaitent explorer les interactions entre profondeur récurrente, routage par experts et variantes d'attention compressée, sans avoir à implémenter chaque composant depuis zéro.

UELes chercheurs et ingénieurs européens peuvent utiliser cette bibliothèque open source pour expérimenter des architectures hybrides récurrentes sans reconstruire les composants depuis zéro, réduisant la barrière à la recherche indépendante.

RecherchePaper
1 source
Les techniques de distillation des LLM expliquées
219MarkTechPost 

Les techniques de distillation des LLM expliquées

La distillation de modèles de langage s'est imposée comme l'une des techniques les plus stratégiques du secteur de l'IA. Le principe repose sur l'utilisation d'un grand modèle "enseignant" pour entraîner un modèle "élève" plus petit et plus efficace, plutôt que de se limiter aux textes bruts issus d'internet. Meta a ainsi utilisé son modèle Llama 4 Behemoth pour entraîner Llama 4 Scout et Llama 4 Maverick. Google a eu recours à ses modèles Gemini lors du développement de Gemma 2 et Gemma 3. DeepSeek, de son côté, a distillé les capacités de raisonnement de DeepSeek-R1 vers des modèles plus légers basés sur Qwen et Llama 3.1. Trois grandes méthodes structurent cette discipline : la distillation par labels souples, où l'élève apprend à reproduire la distribution de probabilités complète de l'enseignant token par token ; la distillation par labels durs, où l'élève imite uniquement la réponse finale générée ; et la co-distillation, où plusieurs modèles apprennent en parallèle en partageant leurs prédictions. Ces techniques permettent à des modèles plus compacts d'hériter de capacités avancées, raisonnement, suivi d'instructions, génération structurée, à un coût computationnel bien inférieur à celui d'un entraînement from scratch. La distillation par labels souples est la plus riche informationnellement : en exposant l'élève à l'ensemble de la distribution de probabilités (par exemple "chat" = 70 %, "chien" = 20 %, "animal" = 10 %), elle lui transmet ce que les chercheurs appellent la "dark knowledge" du modèle, c'est-à-dire les relations sémantiques implicites entre les tokens. En revanche, elle exige un accès aux logits internes du modèle enseignant, impossible avec les modèles propriétaires, et génère des coûts de stockage massifs sur des vocabulaires de 100 000 tokens ou plus. La distillation par labels durs, utilisée notamment par DeepSeek, est plus simple : le modèle enseignant génère des données synthétiques que l'élève apprend à reproduire via un apprentissage supervisé classique, sans accès aux probabilités internes. Ces choix techniques reflètent des enjeux industriels profonds. Dans un contexte où entraîner un grand modèle coûte des dizaines à des centaines de millions de dollars, la distillation représente un levier de démocratisation : elle permet aux équipes disposant de ressources limitées de produire des modèles compétitifs en exploitant la puissance de modèles déjà entraînés. Elle soulève aussi des questions sur la propriété intellectuelle, distiller un modèle fermé à partir de ses sorties publiques se situe dans une zone juridique encore floue. Enfin, la co-distillation, où plusieurs modèles s'entraînent mutuellement, ouvre la voie à des architectures d'apprentissage collaboratif qui pourraient redéfinir la façon dont les prochaines générations de modèles sont construites.

LLMsPaper
1 source
Apprentissage par renforcement avec récompenses vérifiables via GRPO sur SageMaker AI
220AWS ML Blog 

Apprentissage par renforcement avec récompenses vérifiables via GRPO sur SageMaker AI

Amazon Web Services publie une approche technique pour améliorer l'entraînement des grands modèles de langage via le renforcement à récompenses vérifiables, connue sous l'acronyme RLVR (Reinforcement Learning with Verifiable Rewards), déployée sur sa plateforme SageMaker AI. La méthode combine RLVR avec un algorithme d'optimisation appelé GRPO (Group Relative Policy Optimization) et des exemples dits "few-shot" pour affiner la précision des modèles sur des tâches où la réponse correcte est objectivement mesurable. Pour illustrer l'approche, AWS s'appuie sur le jeu de données GSM8K (Grade School Math 8K), une collection de problèmes mathématiques de niveau primaire, qui sert de terrain d'entraînement et d'évaluation. L'ensemble du pipeline est implémenté et documenté pour fonctionner directement sur SageMaker AI, l'infrastructure cloud d'entraînement de modèles d'Amazon. L'enjeu central est celui du "reward hacking", un phénomène bien connu dans l'entraînement par renforcement traditionnel : les modèles apprennent à maximiser leur score sans réellement accomplir la tâche souhaitée, en exploitant des failles dans la définition de la récompense. RLVR contourne ce problème en remplaçant les évaluations humaines, coûteuses et subjectives, par des fonctions de récompense programmatiques et reproductibles, le modèle est noté automatiquement selon des règles précises, sans ambiguïté. GRPO complète ce dispositif en organisant les données d'entraînement en groupes et en optimisant les performances de chaque groupe indépendamment, ce qui réduit la variance d'entraînement, accélère la convergence et produit des modèles plus homogènes sur des catégories variées. Ajoutés à cela, les exemples few-shot servent de modèles de référence qui réduisent l'espace de recherche pendant l'exploration du modèle, lui montrant concrètement à quoi ressemble une bonne réponse. L'approche s'inscrit dans une tendance de fond qui voit l'industrie chercher à réduire la dépendance au feedback humain dans l'entraînement des LLM, un processus long, coûteux et difficile à scaler. Des travaux récents comme DeepSeek-R1 ou les modèles de raisonnement d'OpenAI ont popularisé l'idée que des récompenses vérifiables permettent d'atteindre des niveaux de performance élevés sur des tâches structurées, notamment en mathématiques et en génération de code. AWS positionne SageMaker AI comme une plateforme clé pour que les équipes d'ingénierie puissent reproduire et adapter ces techniques sans repartir de zéro. L'approche est présentée comme généraliste : si le cas d'usage retenu est le calcul mathématique, la combinaison RLVR-GRPO peut s'appliquer à toute tâche disposant de critères de succès objectifs et mesurables, ouvrant la voie à des applications en vérification de code, en manipulation symbolique ou dans tout domaine où la vérité terrain est déterministe.

LLMsTuto
1 source
PORTool : optimisation de politique avec arbre de récompenses pour le raisonnement multi-outils
221Apple Machine Learning 

PORTool : optimisation de politique avec arbre de récompenses pour le raisonnement multi-outils

Des chercheurs ont publié PORTool, un algorithme d'optimisation de politique dit "importance-aware" conçu pour améliorer l'entraînement des agents LLM capables d'utiliser plusieurs outils simultanément. Le système introduit un arbre de récompenses (rewarded tree) qui attribue des crédits à chaque étape intermédiaire d'un raisonnement, plutôt qu'uniquement à l'issue finale d'une tâche. Concrètement, lorsqu'un agent enchaîne des appels à des outils externes avant de produire une réponse, PORTool est capable de noter individuellement chaque décision prise en cours de route. Le problème central que PORTool cherche à résoudre est l'ambiguïté d'attribution de crédit, un obstacle persistant dans l'entraînement des agents multi-outils. Avec les méthodes classiques basées uniquement sur le résultat final, il est impossible de savoir quelles décisions intermédiaires ont contribué au succès ou à l'échec d'une séquence. Ce manque de granularité dégrade la qualité de l'apprentissage et rend les agents peu fiables en conditions réelles. PORTool offre un signal d'entraînement plus précis, ce qui devrait se traduire par des agents mieux capables de mobiliser les bons outils au bon moment. Le raisonnement multi-outils est devenu un enjeu central depuis l'essor des agents autonomes comme GPT-4 avec plugins, ou les architectures ReAct et ToolLLM. Ces systèmes montrent un potentiel considérable pour automatiser des tâches complexes en milieu professionnel, mais leur fiabilité dépend directement de la qualité de leur entraînement. PORTool s'inscrit dans une vague de travaux sur l'apprentissage par renforcement appliqué aux LLM, un domaine en pleine effervescence depuis les succès de DeepSeek-R1 et d'autres modèles à raisonnement renforcé.

RecherchePaper
1 source
Alibaba, ByteDance et Zhipu AI figurent dans le premier classement IA du magazine Time
222SCMP Tech 

Alibaba, ByteDance et Zhipu AI figurent dans le premier classement IA du magazine Time

Le magazine Time a publié pour la première fois un classement dédié à l'intelligence artificielle, intitulé "10 Most Influential AI Companies of 2026", dans le cadre de son palmarès annuel Time100 Most Influential Companies. Trois entreprises chinoises y figurent : Alibaba Group Holding, ByteDance et Zhipu AI. Les sept autres places sont occupées par six sociétés américaines et par Mistral AI, seule représentante européenne du classement. La présence de trois acteurs chinois dans ce top 10 mondial illustre la montée en puissance de l'écosystème IA de Pékin face à la Silicon Valley. ByteDance, connu pour TikTok, s'est imposé dans la course aux grands modèles de langage avec son modèle Doubao. Alibaba pousse son modèle Qwen, disponible en open source, tandis que Zhipu AI, startup soutenue par des fonds d'État, développe la série GLM. Leur inclusion dans un classement américain aussi emblématique que le Time100 signale que la domination américaine sur l'IA n'est plus une évidence pour les observateurs occidentaux eux-mêmes. Ce classement intervient dans un contexte de compétition technologique intense entre les États-Unis et la Chine, aggravée par les restrictions américaines sur les exportations de puces Nvidia vers Pékin. Malgré ces obstacles, les laboratoires chinois ont continué à publier des modèles compétitifs, notamment après le choc DeepSeek début 2025. L'entrée de Mistral AI dans ce palmarès confirme également que l'Europe cherche à s'imposer comme troisième pôle de l'IA mondiale, même si son poids reste modeste face aux deux géants.

UEMistral AI est la seule entreprise européenne dans le classement Time100 IA 2026, signal de reconnaissance internationale pour l'écosystème français mais aussi de la faiblesse relative de l'Europe face aux géants américains et chinois.

BusinessActu
1 source
Affordance-R1 : apprentissage par renforcement pour le raisonnement sur les affordances dans les LLM multimodaux
223arXiv cs.RO 

Affordance-R1 : apprentissage par renforcement pour le raisonnement sur les affordances dans les LLM multimodaux

Des chercheurs ont présenté Affordance-R1, un nouveau modèle d'intelligence artificielle conçu pour permettre aux robots de déterminer précisément comment saisir et manipuler des objets dans leur environnement. Publiée sur arXiv (référence 2508.06206), cette étude introduit le premier cadre unifié d'affordance grounding combinant l'apprentissage par renforcement avec un raisonnement de type chaîne de pensée (Chain-of-Thought, CoT). Le système s'appuie sur une variante de l'optimisation politique appelée GRPO (Group Relative Policy Optimization) et a été entraîné sur un nouveau jeu de données spécialement constitué pour l'occasion, baptisé ReasonAff. Malgré l'absence de données de raisonnement explicite durant l'entraînement, le modèle parvient à une généralisation zéro-shot convaincante et développe des capacités de raisonnement émergentes lors de l'inférence. Le code et le jeu de données sont disponibles publiquement sur GitHub. Cette avancée concerne directement la robotique incarnée, l'interaction humain-robot et la manipulation d'objets en environnement ouvert. L'enjeu central est la capacité d'un robot à identifier, sans entraînement préalable sur un objet donné, quelle zone précise saisir ou activer pour accomplir une tâche, par exemple tenir une tasse par son anse ou appuyer sur le bouton d'un appareil. Jusqu'ici, les modèles existants échouaient à transférer cette compréhension d'un objet à un autre, faute d'un raisonnement structuré. Affordance-R1 comble ce manque en permettant une généralisation hors-domaine (OOD), ce qui pourrait accélérer le déploiement de robots polyvalents dans des environnements industriels, domestiques ou médicaux. Le concept d'affordance, emprunté à la psychologie cognitive, désigne les actions qu'un objet permet naturellement à un agent. Dans le domaine de la robotique IA, le défi est d'apprendre à un modèle à percevoir ces possibilités d'action de façon générique, sans dépendre d'une liste exhaustive d'objets connus. Les approches précédentes reposaient sur de la supervision directe, limitant leur adaptabilité face à des situations inédites. L'utilisation du GRPO, une méthode d'apprentissage par renforcement popularisée notamment par DeepSeek, représente ici un changement de paradigme : plutôt que d'enseigner explicitement le raisonnement, on récompense le modèle selon des critères de format, de perception et de cognition. Cette approche rejoint une tendance plus large visant à doter les grands modèles multimodaux d'une véritable capacité de planification physique dans le monde réel.

RecherchePaper
1 source
Baidu lance GenFlow 4.0 et améliore ses agents de stockage cloud et de bureautique
224Pandaily 

Baidu lance GenFlow 4.0 et améliore ses agents de stockage cloud et de bureautique

Le 27 avril, Baidu a présenté GenFlow 4.0 lors de son événement AI Day, une mise à jour majeure de son système d'agents IA généraliste. Cette nouvelle version est désormais disponible sur les versions PC et mobile de Baidu Netdisk, le service de stockage cloud de l'entreprise, et intègre des agents spécialisés pour les tâches bureautiques sur PowerPoint, Excel et Word. Les utilisateurs peuvent lancer une tâche depuis leur mobile et la faire exécuter sur PC, créant ainsi des flux de travail multi-appareils fluides. Depuis son lancement initial en avril 2025, GenFlow a atteint 100 millions d'utilisateurs actifs mensuels et 200 millions d'exécutions de tâches par mois. La version 4.0 améliore particulièrement la reconnaissance d'intention, la décomposition de tâches complexes, la coordination entre outils et la restitution des résultats. En pratique, GenFlow 4.0 permet des enchaînements bureautiques complets : analyser des données dans Excel, générer automatiquement une présentation PowerPoint à partir des résultats, puis compiler un rapport Word, le tout sans intervention manuelle entre chaque étape. Le système s'étend également à l'édition vidéo, à la gestion de photos et aux usages pédagogiques, en exploitant les fichiers déjà stockés dans le cloud. Pour renforcer la sécurité des données, Baidu introduit une fonctionnalité "espace de travail" qui limite l'accès de l'IA aux seuls fichiers autorisés. Côté entreprise, une fonctionnalité "Team Space" permet la collaboration multi-utilisateurs et la gestion de tâches par agents, déjà adoptée par plus de 10 000 organisations. Cette annonce s'inscrit dans la course acharnée que se livrent les géants technologiques chinois pour intégrer l'IA agentique dans leurs écosystèmes productifs. Baidu, qui doit faire face à une concurrence accrue d'Alibaba, Tencent et de nouveaux acteurs comme DeepSeek, mise sur Netdisk comme point d'ancrage stratégique pour déployer ses agents au quotidien. L'intégration directe dans un service de stockage à 100 millions d'utilisateurs actifs constitue un levier de diffusion considérable, et la direction prise vers l'automatisation de tâches complexes multi-applications pourrait redéfinir les standards attendus des assistants IA en milieu professionnel.

OutilsOutil
1 source
LaDiR : la diffusion latente améliore le raisonnement textuel des LLMs
225Apple Machine Learning 

LaDiR : la diffusion latente améliore le raisonnement textuel des LLMs

Des chercheurs ont publié LaDiR (Latent Diffusion Reasoner), un nouveau cadre de raisonnement qui couple les grands modèles de langage existants à des modèles de diffusion latente. L'objectif : dépasser les limites inhérentes à la génération autoreégressive, en introduisant une étape de raffinement itératif dans un espace de représentation continu structuré, avant que le modèle ne produise sa réponse finale en texte. Le problème visé est fondamental. Lorsqu'un LLM génère token par token, il ne peut pas revenir modifier ce qu'il a déjà écrit, une contrainte qui pénalise les tâches de raisonnement complexes où la solution exige d'explorer plusieurs pistes et de corriger des erreurs en cours de route. LaDiR contourne cette limite en faisant "mûrir" le raisonnement dans un espace latent continu, via un processus de diffusion, avant de le transcrire en langage naturel. Cela permet une exploration plus diverse et un affinement global de la chaîne de pensée, impossible avec le décodage autorégressif classique. L'approche s'inscrit dans une vague de recherches cherchant à améliorer le raisonnement des LLMs au-delà du simple chain-of-thought (CoT), popularisé notamment par les modèles o1 d'OpenAI et R1 de DeepSeek. Contrairement aux méthodes qui allongent simplement le texte intermédiaire, LaDiR exploite l'espace continu des représentations pour structurer ce raisonnement de façon plus riche. La compatibilité avec des modèles existants, sans réentraînement complet, constitue un avantage pratique notable si les résultats se confirment sur des benchmarks de référence.

RecherchePaper
1 source
Implémentation de Microsoft OpenMementos : analyse des traces, compression de contexte et préparation des données d'affinage
226MarkTechPost 

Implémentation de Microsoft OpenMementos : analyse des traces, compression de contexte et préparation des données d'affinage

Microsoft a publié OpenMementos, un jeu de données conçu pour entraîner des modèles de langage capables de raisonnement long, structuré et compressible. Le dataset, disponible sur HuggingFace sous l'identifiant microsoft/OpenMementos, organise chaque trace de raisonnement en une série de blocs délimités par des tokens spéciaux (<|blockstart|>, <|blockend|>) accompagnés chacun de leur résumé condensé, appelé memento, encadré par <|summarystart|> et <|summaryend|>. Un tutoriel technique détaillé, conçu pour fonctionner directement dans Google Colab, montre comment accéder au dataset en mode streaming sans le télécharger intégralement, analyser sa structure interne, mesurer les taux de compression bloc-par-bloc sur 500 exemples répartis selon le domaine et la source, puis préparer les données pour un fine-tuning supervisé. L'ensemble du pipeline repose sur des bibliothèques Python standard : HuggingFace Datasets, Transformers, Pandas et Matplotlib. La valeur centrale d'OpenMementos réside dans son architecture de compression. Chaque réponse longue d'un modèle de raisonnement est découpée en blocs discrets, puis chaque bloc est automatiquement réduit à un memento de quelques phrases. Le tutoriel mesure ce rapport de compression en caractères et en mots par domaine, révélant à quel point les mementos permettent de préserver l'essentiel du raisonnement avec une fraction du volume textuel. Cette structure est directement exploitable pour l'entraînement : plutôt que de forcer un modèle à reproduire intégralement des chaînes de pensée verbeuses, on peut l'entraîner à produire des résumés intermédiaires compacts, ce qui réduit les coûts de calcul à l'inférence tout en maintenant la cohérence logique sur des problèmes complexes. Ce travail s'inscrit dans une tendance de fond qui agite les laboratoires d'IA depuis fin 2024 : comment rendre les modèles de raisonnement économiquement viables. Les approches chain-of-thought et les architectures de type "thinking model", popularisées par OpenAI avec o1 puis par DeepSeek-R1 et Qwen-QwQ, génèrent des traces de raisonnement extrêmement longues et coûteuses à stocker, transmettre et inférer. Microsoft répond à ce défi avec une solution de compression supervisée des traces, en annotant explicitement les résumés intermédiaires au niveau des blocs. OpenMementos fournit ainsi une base d'entraînement structurée pour des modèles capables de "penser de façon compacte", une propriété qui pourrait devenir déterminante à mesure que les applications industrielles exigent des latences et des coûts d'inférence maîtrisés sur des tâches de raisonnement multi-étapes.

RecherchePaper
1 source
Vidéo : SamuRoid, le robot humanoïde chinois compact aux interactions plus intelligentes
227Interesting Engineering 

Vidéo : SamuRoid, le robot humanoïde chinois compact aux interactions plus intelligentes

SamuRoid, un robot humanoïde compact développé par la société chinoise XiaoR Geek Technology basée à Shenzhen, vient d'être présenté comme une nouvelle plateforme d'IA embarquée accessible aux chercheurs et développeurs. Mesurant 390 mm de hauteur pour 2,3 kg, il embarque 22 servomoteurs haute-couple de la série XRS couvrant l'intégralité du corps, une caméra 1080p grand angle sur une nacelle 2 axes, un microphone USB intégré, ainsi qu'une connectivité Wi-Fi 5 double bande et Bluetooth 5.0. Son cerveau est un Raspberry Pi 4 Model B disponible en 4 ou 8 Go de RAM. La batterie 12V 3000 mAh lui offre environ une heure d'autonomie. La version Professional Edition est proposée à environ 1 565 dollars, tandis que des éditions Developer et Flagship plus complètes sont actuellement en rupture de stock. Ce qui distingue SamuRoid de ses prédécesseurs, c'est son niveau d'intégration logicielle et ses capacités multimodales. Le robot fonctionne sous ROS (Robot Operating System), avec un code source ouvert compatible C++ et Python, et intègre OpenCV pour la reconnaissance faciale, le suivi de couleurs et la détection de QR codes. Surtout, il se connecte à des grands modèles de langage comme DeepSeek et Doubao, ce qui lui permet de comprendre des instructions en langage naturel plutôt que des commandes rigides. Si un utilisateur dit qu'il est fatigué et veut s'amuser, le système interprète l'intention et déclenche une action appropriée, comme une chorégraphie, tout en fournissant un retour vocal. Ce saut qualitatif positionne SamuRoid comme un outil de recherche crédible pour explorer l'interaction homme-machine de nouvelle génération, à un prix bien en dessous des plateformes industrielles. L'essor de robots humanoïdes compacts et ouverts reflète une tendance de fond dans l'industrie robotique mondiale : rendre l'IA incarnée accessible hors des grands laboratoires. Jusqu'ici, ce segment était dominé par des plateformes coûteuses ou des jouets aux capacités limitées. XiaoR Geek tente de combler cet écart en proposant une architecture ouverte compatible avec les workflows ROS standard, adoptés par la grande majorité des chercheurs en robotique. La Chine multiplie ces initiatives, portée par un écosystème de fabrication performant et des modèles de langage locaux comme DeepSeek qui rivalisent désormais avec les offres occidentales. SamuRoid arrive dans un contexte où plusieurs acteurs, d'Agility Robotics à Figure AI en passant par Boston Dynamics, cherchent à démocratiser l'humanoïde. La question ouverte reste celle de la durée d'autonomie, une heure restant un frein réel pour des usages continus, et de la robustesse en dehors des environnements contrôlés.

RobotiqueActu
1 source
Xiaomi lance la bêta publique de sa série de modèles d'IA MiMo-V2.5
228Pandaily 

Xiaomi lance la bêta publique de sa série de modèles d'IA MiMo-V2.5

Xiaomi a lancé la bêta publique de sa nouvelle série de modèles de langage MiMo-V2.5, avec une mise à disposition en open source de MiMo-V2.5 et MiMo-V2.5-Pro annoncée pour très prochainement. La famille MiMo-V2.5 comprend quatre modèles distincts : MiMo-V2.5, V2.5-Pro, V2.5-TTS et V2.5-ASR, chacun conçu pour améliorer le raisonnement, la gestion de contextes longs, le suivi d'instructions complexes ou ambiguës, et la compréhension multimodale. Xiaomi a également annoncé des ajustements tarifaires sur son offre Token Plan. Le fleuron de la gamme, MiMo-V2.5-Pro, est présenté comme le modèle le plus puissant jamais développé par l'entreprise. Les performances revendiquées sont ambitieuses : en tests internes, MiMo-V2.5-Pro se montre compétitif face à Claude Opus 4.6 et GPT-5.4 sur des tâches d'agent général, d'ingénierie logicielle complexe et d'exécution de tâches longues. Associé au bon environnement d'exécution, le modèle peut enchaîner de manière fiable des séquences impliquant près de 1 000 appels d'outils au cours d'une même session. Sa capacité à suivre des instructions implicites tout en maintenant une cohérence logique sur de longues interactions représente une avancée notable par rapport à la génération précédente, et le positionne comme un outil crédible pour des charges de travail professionnelles exigeantes. Cette annonce s'inscrit dans une stratégie d'accélération claire de Xiaomi dans la course mondiale aux grands modèles de langage. Longtemps perçu avant tout comme fabricant de smartphones et d'électronique grand public, le groupe chinois investit massivement dans l'IA depuis plusieurs trimestres, cherchant à s'imposer face à des acteurs comme Alibaba, Baidu ou DeepSeek sur le marché domestique, tout en visant une reconnaissance internationale grâce à l'open source. La publication prochaine des poids du modèle devrait permettre à la communauté de valider les performances annoncées et d'évaluer la place réelle de Xiaomi dans l'écosystème mondial de l'IA.

UELa mise en open source prochaine des poids du modèle pourrait intéresser les développeurs et entreprises européennes cherchant des alternatives open source compétitives, sans impact réglementaire direct sur la France ou l'UE.

LLMsActu
1 source
Tesla Chine intègre le modèle d'IA Doubao dans son système embarqué
229Pandaily 

Tesla Chine intègre le modèle d'IA Doubao dans son système embarqué

Tesla China a finalisé le dépôt réglementaire de son système vocal embarqué le 20 avril 2026, ouvrant la voie à l'intégration du modèle d'intelligence artificielle Doubao de ByteDance dans ses véhicules vendus en Chine. Selon des informations relayées par AI Daily, la page officielle de Tesla China avait déjà révélé dans ses "Conditions d'utilisation de l'assistant vocal embarqué" que la Model Y L serait équipée à la fois du modèle Doubao et de DeepSeek, tous deux accessibles via Volcano Engine, la plateforme cloud de ByteDance. La répartition des rôles est précise : Doubao prend en charge les commandes vocales courantes, réglage de la navigation, contrôle de la lecture multimédia, ajustements climatiques et consultation du manuel propriétaire, tandis que DeepSeek alimente des fonctionnalités conversationnelles plus avancées, permettant des échanges de nature plus générale avec le véhicule. Cette intégration marque une étape concrète dans la localisation de l'expérience Tesla en Chine, marché qui représente une part critique de ses ventes mondiales. En adoptant deux modèles d'IA développés par des acteurs chinois majeurs, Tesla reconnaît implicitement que les LLM occidentaux ne suffisent pas à répondre aux attentes des consommateurs locaux, qu'il s'agisse de la langue, des usages culturels ou des exigences réglementaires. Pour les utilisateurs, cela se traduit par un assistant embarqué nettement plus capable et mieux adapté aux conditions de conduite chinoises. Cette décision s'inscrit dans un contexte de concurrence intense sur le marché automobile chinois, où des constructeurs locaux comme BYD, NIO ou Li Auto intègrent depuis plusieurs années des assistants IA avancés directement dans leurs plateformes. Tesla, longtemps en retard sur ce volet en Chine, avait déjà engagé des discussions avec Baidu pour la cartographie et les services connectés. Le choix de Doubao, modèle phare de ByteDance aux centaines de millions d'utilisateurs, et de DeepSeek, devenu en quelques mois une référence mondiale en matière d'efficience des LLM, reflète la volonté de Tesla de s'aligner rapidement sur les standards locaux pour ne pas perdre de terrain face à une industrie nationale en pleine accélération technologique.

OutilsActu
1 source
Alibaba lance l'avatar "Qwen XiaoJiuWo" pour unifier son écosystème d'assistants IA
230Pandaily 

Alibaba lance l'avatar "Qwen XiaoJiuWo" pour unifier son écosystème d'assistants IA

Alibaba a officiellement lancé le 22 avril 2026 "Qwen XiaoJiuWo", un avatar numérique destiné à incarner l'interface unifiée de tout son écosystème d'intelligence artificielle Qwen. Ce personnage virtuel sera intégré à l'application Qwen avant d'être progressivement déployé sur les grandes plateformes du groupe : Taobao, Fliggy, Amap et Alipay. Selon les données du registre commercial, Alibaba (China) Co., Ltd. a déposé plusieurs marques liées à "Qwen XiaoJiuWo" dès le 10 mars 2026, couvrant des domaines aussi variés que l'IA en tant que service (AIaaS), les logiciels de chatbot et la robotique humanoïde. Ces dépôts sont encore en cours d'examen. L'application Qwen comptait en mars 2026 quelque 166 millions d'utilisateurs actifs mensuels, selon QuestMobile, ce qui la place en deuxième position parmi les applications natives d'IA en Chine. Sur le seul premier trimestre 2026, la base d'utilisateurs a progressé d'environ 126 millions. Ce lancement ne constitue pas un nouveau produit à proprement parler, mais une stratégie de cohérence de marque dans un marché extrêmement concurrentiel. En dotant son assistant d'une identité visuelle forte et reconnaissable, Alibaba cherche à fidéliser ses utilisateurs et à créer un sentiment de continuité entre des plateformes très différentes. La fréquence d'utilisation mensuelle reste cependant un point de vigilance : avec 19,8 sessions par utilisateur en moyenne, Qwen se situe en dessous de plusieurs concurrents directs, ce qui suggère que l'engagement reste à consolider malgré la croissance spectaculaire du nombre d'inscrits. Ce mouvement s'inscrit dans une compétition acharnée entre les géants technologiques chinois pour dominer le marché de l'IA grand public. Baidu avec Ernie Bot, ByteDance et ses propres modèles, ainsi que des acteurs plus récents comme DeepSeek exercent une pression croissante sur Alibaba. Le dépôt de marques incluant la robotique humanoïde laisse entrevoir des ambitions bien au-delà du simple chatbot. Alibaba semble vouloir faire de Qwen XiaoJiuWo un point d'entrée transversal vers l'ensemble de ses services numériques, pariant sur l'unification de l'expérience utilisateur comme levier de différenciation à long terme.

OutilsOpinion
1 source
LLMs+
231MIT Technology Review 

LLMs+

Depuis le lancement de ChatGPT fin 2022, les grands modèles de langage (LLM) ont envahi le quotidien de centaines de millions d'utilisateurs et provoqué une course effrénée dans toute l'industrie technologique. Aujourd'hui, la prochaine grande rupture se dessine déjà, et elle ne remplace pas les LLM : elle les prolonge. Ces nouveaux modèles, que l'on pourrait appeler les LLM+, sont conçus pour résoudre des problèmes complexes et multi-étapes qui prendraient des jours ou des semaines à un humain, en opérant de manière autonome sur des durées prolongées. Deux axes de progrès dominent la recherche actuelle : rendre les modèles plus efficaces et moins coûteux à faire tourner, et étendre leur capacité à traiter de grandes quantités d'information sans perdre le fil. Sur le plan de l'efficacité, plusieurs approches prometteuses émergent. Le "mixture-of-experts" consiste à fragmenter un LLM en sous-modules spécialisés, dont seule une partie est activée selon la tâche en cours, réduisant ainsi massivement la charge de calcul. D'autres chercheurs envisagent d'abandonner les transformeurs, l'architecture neuronale dominante depuis plusieurs années, au profit des modèles de diffusion, habituellement réservés à la génération d'images et de vidéos. En 2025, la startup chinoise DeepSeek a présenté une méthode d'encodage du texte dans des images pour comprimer les coûts de traitement. Ces innovations pourraient rendre les LLM accessibles à une gamme beaucoup plus large d'applications industrielles et académiques, en abaissant significativement les barrières financières à leur déploiement. L'autre défi central est celui de la fenêtre de contexte, soit la quantité d'information qu'un modèle peut traiter en une seule fois. Il y a deux ans, cette limite se situait à quelques milliers de tokens, soit une trentaine de pages. Les modèles actuels atteignent désormais le million de tokens, l'équivalent d'une pile entière de livres. Mais plus la fenêtre s'allonge, plus les modèles tendent à dériver ou à perdre leur cohérence sur des tâches longues. Une publication récente de chercheurs du MIT CSAIL propose une réponse architecturale : les LLM récursifs. Au lieu d'ingérer un contexte géant d'un seul bloc, ces modèles découpent leur entrée en fragments, les transmettent à des copies d'eux-mêmes qui peuvent elles-mêmes subdiviser et redistribuer le travail. Cette approche distribuée se révèle nettement plus fiable sur des tâches complexes et prolongées, et pourrait constituer le socle des futurs systèmes d'IA capable de travailler en autonomie sur des défis scientifiques ou organisationnels de grande envergure.

LLMsPaper
1 source
232MarkTechPost 

Entraînement, alignement et déploiement des LLM : analyse technique approfondie

L'entraînement d'un grand modèle de langage (LLM) moderne repose sur un pipeline en plusieurs étapes distinctes, chacune jouant un rôle précis dans la transformation d'un réseau de neurones brut en un système intelligent et déployable. La première phase, le pré-entraînement, consiste à exposer le modèle à des corpus massifs de textes, livres, sites web, code source, afin qu'il développe une compréhension générale du langage, de la grammaire, du raisonnement et des connaissances du monde. Vient ensuite le fine-tuning supervisé (SFT), où des paires entrée-sortie soigneusement vérifiées permettent d'orienter le comportement du modèle vers des tâches précises, un style de réponse ou des règles métier spécifiques. Pour rendre cette adaptation plus accessible sans recalculer l'intégralité des paramètres du modèle, des techniques comme LoRA (Low-Rank Adaptation) et QLoRA (sa variante quantifiée) permettent un fine-tuning efficace en n'ajustant qu'une fraction des poids. L'alignement avec les préférences humaines passe quant à lui par le RLHF (Reinforcement Learning from Human Feedback), qui affine les sorties selon des critères de sécurité et d'utilité. Plus récemment, GRPO (Group Relative Policy Optimization) est apparu pour renforcer les capacités de raisonnement structuré et de résolution de problèmes en plusieurs étapes. Comprendre ce pipeline est essentiel pour quiconque développe ou intègre des LLMs dans des produits réels. Chaque étape conditionne la suivante : un pré-entraînement faible rend le fine-tuning peu efficace, et un mauvais alignement produit des modèles imprévisibles ou dangereux en production. Le SFT, par exemple, peut transformer une réponse générique ("Essayez de réinitialiser votre mot de passe") en une réponse structurée et empathique adaptée au service client. Les techniques LoRA et QLoRA démocratisent l'adaptation de modèles de grande taille sur du matériel accessible, réduisant les coûts de calcul de manière significative. Le RLHF, popularisé notamment par OpenAI avec ChatGPT, reste la référence pour aligner les modèles sur les attentes humaines, tandis que GRPO représente la nouvelle frontière pour les modèles de raisonnement comme DeepSeek-R1 ou les variantes o1 d'OpenAI. Ce pipeline s'est construit progressivement depuis les premières architectures Transformer de 2017, avec des jalons comme GPT-3 en 2020, qui a démontré la puissance du pré-entraînement à grande échelle, puis InstructGPT en 2022, qui a introduit le RLHF comme standard d'alignement. Aujourd'hui, la course entre les acteurs majeurs, OpenAI, Google DeepMind, Meta, Mistral, Anthropic, se joue précisément sur l'optimisation de ces étapes : qualité des données d'entraînement, efficacité du fine-tuning, robustesse de l'alignement. La montée en puissance des modèles de raisonnement en 2024-2025 a replacé GRPO et les approches similaires au centre des stratégies de recherche, laissant entrevoir des LLMs capables d'une résolution de problèmes complexes nettement plus fiable qu'aujourd'hui.

UEMistral, acteur français, est cité parmi les compétiteurs majeurs dans la course à l'optimisation des pipelines d'entraînement LLM.

LLMsTuto
1 source
233Latent Space 

[AINews] Classement des meilleurs modèles locaux - avril 2026

En avril 2026, la communauté des modèles d'IA locaux a établi un nouveau consensus sur les meilleurs modèles disponibles, après une veille régulière des forums Reddit comme r/localLlama et r/localLLM. Le classement ne repose pas sur les benchmarks théoriques mais sur ce que les utilisateurs recommandent concrètement au quotidien. Qwen 3.5 s'impose comme la famille la plus recommandée toutes catégories confondues, tandis que Gemma 4 de Google gagne rapidement en popularité pour les déploiements locaux de petite et moyenne taille. GLM-5 et GLM-4.7 figurent désormais dans les discussions sur les "meilleurs modèles open-source", aux côtés de MiniMax M2.5 et M2.7, particulièrement cités pour les tâches agentiques et les workflows à forte utilisation d'outils. DeepSeek V3.2 reste solidement dans le peloton de tête des modèles open-weight généralistes, et GPT-oss 20B émerge comme option pratique pour un usage local, notamment pour ses variantes non censurées. Pour le code, le verdict est sans appel : Qwen3-Coder-Next domine largement. Ce palmarès reflète un basculement significatif dans la manière dont les développeurs et les passionnés consomment l'IA : plutôt que de dépendre de services cloud payants, ils privilégient des modèles qu'ils peuvent faire tourner sur leur propre matériel. Cette dynamique démocratise l'accès à des capacités avancées tout en préservant la confidentialité des données. La performance de Qwen 3.5 sur un large spectre d'usages indique que les modèles de taille intermédiaire ont atteint un niveau de maturité suffisant pour remplacer des API commerciales dans de nombreux contextes professionnels. Ce relevé s'inscrit dans une accélération générale de l'écosystème open-weight depuis fin 2024, portée par des acteurs comme Alibaba (Qwen), Google (Gemma), Zhipu AI (GLM) et DeepSeek. La compétition s'est déplacée des grands laboratoires fermés vers un terrain où les sorties se succèdent à un rythme soutenu et où la communauté joue un rôle d'arbitre. La prochaine génération de modèles locaux, notamment Qwen3-Coder-Next pour le développement logiciel, laisse entrevoir des capacités agentiques croissantes qui pourraient transformer les workflows d'ingénierie sans nécessiter de connexion à des services externes.

UEL'adoption croissante de modèles open-weight locaux offre aux développeurs et entreprises européens une alternative concrète aux API cloud américaines, réduisant l'exposition aux risques de dépendance et renforçant la souveraineté des données.

LLMsActu
1 source
Guide complet d'utilisation de ModelScope : recherche de modèles, inférence, fine-tuning, évaluation et export
234MarkTechPost 

Guide complet d'utilisation de ModelScope : recherche de modèles, inférence, fine-tuning, évaluation et export

ModelScope, la plateforme de partage de modèles d'intelligence artificielle développée par Alibaba et son laboratoire DAMO Academy, s'impose comme une alternative crédible à Hugging Face pour les développeurs souhaitant accéder à des modèles pré-entraînés, des jeux de données et des pipelines d'inférence. Un tutoriel complet publié récemment détaille un workflow de bout en bout exécutable sur Google Colab, couvrant l'installation de l'environnement, la recherche de modèles via le hub ModelScope, le téléchargement de snapshots comme BERT, le chargement du jeu de données IMDB, le fine-tuning d'un classificateur de sentiment, son évaluation et son export pour déploiement. La procédure repose sur un écosystème de bibliothèques Python incluant PyTorch, Transformers d'Hugging Face, Accelerate, scikit-learn et Optimum, avec une compatibilité GPU vérifiée dès le départ via CUDA. Ce type de guide pratique a une valeur concrète pour les équipes d'ingénierie et de recherche qui cherchent à industrialiser leurs workflows IA sans repartir de zéro. En montrant que ModelScope s'intègre nativement avec les outils Hugging Face, notamment les pipelines Transformers pour l'analyse de sentiment ou la vision par ordinateur, le tutoriel réduit la barrière à l'entrée pour les équipes déjà familières de cet écosystème. La possibilité de télécharger localement des snapshots de modèles, d'accéder à des datasets comme IMDB via l'API MsDataset, et d'exporter les modèles fine-tunés vers des formats de production (via Optimum) en fait un outil pertinent aussi bien pour l'expérimentation que pour des déploiements à plus grande échelle. ModelScope a été lancé en 2022 par Alibaba DAMO Academy avec l'ambition de construire un écosystème ouvert de modèles centré sur la communauté chinoise et internationale du machine learning. La plateforme héberge des milliers de modèles dans des domaines variés, NLP, vision, audio, multimodal, et se positionne directement face à Hugging Face, qui reste la référence mondiale avec plus de 500 000 modèles disponibles. La dépendance au réseau chinois pour certaines API (la recherche de modèles peut être indisponible hors de Chine, comme le mentionne le tutoriel lui-même) constitue une friction réelle pour les utilisateurs occidentaux. Néanmoins, avec l'accélération des sorties de modèles chinois performants comme Qwen, DeepSeek ou Yi, ModelScope devient un point d'accès incontournable pour quiconque souhaite travailler avec ces modèles dès leur publication, souvent avant leur disponibilité sur d'autres plateformes.

OutilsTuto
1 source
Affinage par renforcement sur Amazon Bedrock : bonnes pratiques
235AWS ML Blog 

Affinage par renforcement sur Amazon Bedrock : bonnes pratiques

Amazon a intégré le Reinforcement Fine-Tuning (RFT) à sa plateforme Bedrock, permettant aux entreprises de personnaliser ses modèles maison Amazon Nova ainsi que plusieurs modèles open source sans avoir besoin de vastes jeux de données étiquetés. Selon les résultats publiés par l'entreprise, cette technique peut générer jusqu'à 66 % de gain de précision par rapport aux modèles de base, à un coût et une complexité réduits. Concrètement, le RFT fonctionne différemment de l'apprentissage supervisé classique : au lieu de s'entraîner sur des paires entrée/sortie correctes, le modèle génère des réponses candidates, qui sont ensuite notées par une fonction de récompense, et ses paramètres sont mis à jour pour favoriser les réponses les mieux notées. Cette boucle itéractive, générer, scorer, ajuster, permet au modèle de découvrir des stratégies que de simples exemples statiques ne pourraient pas lui enseigner. La fonction de récompense est implémentée via AWS Lambda, directement appelée par Bedrock pendant l'entraînement. Cette approche ouvre des possibilités concrètes pour deux grandes familles de tâches. D'un côté, les tâches à critères vérifiables automatiquement : génération de code devant passer des tests unitaires, raisonnement mathématique avec réponses exactes, extraction de données structurées devant respecter un schéma strict, ou orchestration d'API. C'est ce qu'Amazon appelle le RLVR (Reinforcement Learning with Verifiable Rewards). De l'autre côté, les tâches subjectives comme la modération de contenu, les chatbots ou la rédaction créative, où un modèle juge évalue les sorties selon une grille d'évaluation détaillée, approche baptisée RLAIF (Reinforcement Learning with AI Feedback). Pour les équipes techniques, l'intérêt est d'éviter la collecte laborieuse de milliers d'exemples annotés, particulièrement difficile à réaliser pour des tâches de raisonnement complexe où l'expertise humaine est coûteuse. Le RFT s'inscrit dans une tendance lourde de l'industrie IA depuis les succès de DeepSeek-R1 début 2025, qui avait démontré que l'entraînement par renforcement sur des tâches vérifiables pouvait produire des capacités de raisonnement spectaculaires à moindre coût. Amazon emboîte le pas en industrialisant cette technique dans un service cloud managé, ce qui la rend accessible aux équipes sans infrastructure d'entraînement propre. En proposant RFT directement dans Bedrock avec des métriques de suivi intégrées et des guidelines de tuning d'hyperparamètres, Amazon cherche à s'imposer face à Azure et Google Cloud sur le segment de la personnalisation de modèles en entreprise. Le dataset GSM8K, utilisé comme exemple de référence dans la documentation, illustre bien l'ambition : transformer des modèles généralistes en spécialistes fiables sur des domaines métier précis, sans expertise en machine learning approfondie.

UELes entreprises européennes sur AWS peuvent désormais affiner des modèles IA sans jeux de données annotés massifs ni infrastructure ML propre, abaissant la barrière d'entrée pour la personnalisation de modèles en production.

OutilsOutil
1 source
Amazon SageMaker AI accélère les appels d'outils des agents autonomes avec la personnalisation de modèles sans serveur
236AWS ML Blog 

Amazon SageMaker AI accélère les appels d'outils des agents autonomes avec la personnalisation de modèles sans serveur

Amazon a introduit une fonctionnalité de personnalisation de modèles sans serveur dans SageMaker AI, permettant aux équipes d'améliorer drastiquement les capacités d'appel d'outils des agents IA sans gérer d'infrastructure GPU. Dans un cas concret publié début avril 2026, des ingénieurs ont affiné le modèle Qwen 2.5 7B Instruct en utilisant la technique RLVR (Reinforcement Learning with Verifiable Rewards) et ont obtenu une amélioration de 57% du score de qualité des appels d'outils sur des scénarios inédits, c'est-à-dire des outils que le modèle n'avait jamais vus lors de l'entraînement. La méthode repose sur un principe simple : le modèle génère huit réponses candidates par prompt, une fonction de récompense vérifie lesquelles sont correctes, et l'algorithme GRPO (Group Relative Policy Optimization) renforce les comportements qui surpassent la moyenne du groupe. SageMaker AI prend en charge les familles de modèles Amazon Nova, Llama, Qwen et DeepSeek, avec un suivi des métriques via MLflow intégré. L'enjeu est concret : les agents IA en production échouent fréquemment lors des appels d'outils, qu'il s'agisse d'halluciner des fonctions inexistantes, de passer des paramètres incorrects, ou de déclencher une action là où ils devraient demander une clarification. Ces erreurs bloquent le déploiement en production et détruisent la confiance des utilisateurs. La nouvelle approche serverless d'Amazon supprime l'obstacle opérationnel majeur que représentait jusqu'ici le fine-tuning par renforcement : achat de GPU, orchestration mémoire entre les phases de rollout et d'entraînement, infrastructure de récompenses, gestion des checkpoints. Les équipes peuvent désormais se concentrer sur leurs données, leur modèle et leur fonction de récompense, le reste étant géré par la plateforme. Le fine-tuning supervisé classique (SFT) montre ses limites pour ce type de tâche : il nécessite des exemples étiquetés pour chaque comportement souhaité, mais peine à généraliser la prise de décision entre appeler un outil, demander des informations supplémentaires, ou refuser d'agir. RLVR contourne ce problème en exploitant la nature vérifiable des appels d'outils : soit le modèle a appelé la bonne fonction avec les bons paramètres, soit non. Cette objectivité binaire rend l'appel d'outils particulièrement adapté à l'apprentissage par renforcement. Amazon positionne cette offre dans un marché de l'IA agentique en forte croissance, où des acteurs comme Google (Vertex AI), Microsoft (Azure ML) et des startups spécialisées se disputent les équipes qui cherchent à industrialiser des agents fiables, avec un accès simplifié via SageMaker Studio et un compte AWS standard.

OutilsActu
1 source
Marc Andreessen s'interroge sur la mort du navigateur, Pi + OpenClaw, et pourquoi cette fois c'est différent
237Latent Space 

Marc Andreessen s'interroge sur la mort du navigateur, Pi + OpenClaw, et pourquoi cette fois c'est différent

Marc Andreessen, cofondateur du fonds de capital-risque Andreessen Horowitz (a16z), qui vient de lever 15 milliards de dollars, s'est exprimé dans un épisode du podcast Latent Space enregistré dans les bureaux légendaires de Sand Hill Road. Face aux animateurs swyx et Alessio, il a développé sa thèse centrale : l'intelligence artificielle n'est pas un nouveau cycle de hype, mais l'aboutissement de quatre-vingts ans de progrès scientifique cumulé. Des réseaux de neurones des années 1980 aux systèmes experts, en passant par AlexNet en 2012 et les transformers, jusqu'aux modèles de raisonnement et aux agents autonomes d'aujourd'hui, Andreessen voit dans ce moment une convergence historique. Il a également mis en avant deux projets qu'il considère comme des percées architecturales majeures : Pi et OpenClaw, une combinaison de modèle de langage, shell Unix, système de fichiers, Markdown et boucle cron qu'il compare à l'invention d'Unix en termes d'importance pour l'industrie logicielle. Pour Andreessen, ce qui distingue fondamentalement ce cycle des précédents, c'est le saut qualitatif entre les LLM classiques et les modèles de raisonnement capables de coder, d'agir de manière autonome et potentiellement de s'améliorer eux-mêmes de façon récursive. Il souligne que la vraie contrainte n'est plus technique mais institutionnelle : les organisations humaines, leurs incitations et leurs structures sociales peinent à absorber un changement aussi rapide. Sur la question des infrastructures, il nuance la comparaison avec la bulle des télécoms de 2000 : les acheteurs actuels de capacités IA sont des géants aux bilans solides, et la demande existe déjà. Il défend également l'importance de l'IA embarquée en local, citant la confidentialité, la confiance et l'économie comme facteurs structurels favorisant les modèles tournant sur Apple Silicon ou des puces dédiées. Andreessen incarne une génération rare d'investisseurs ayant vécu de l'intérieur plusieurs révolutions technologiques : il a créé Mosaic, le premier navigateur web grand public, avant de cofonder Netscape et a16z. Son regard sur l'open source est particulièrement éclairant : il décrit DeepSeek comme "un cadeau au monde", non seulement parce que les modèles sont gratuits, mais parce qu'ils propagent la compréhension profonde de ces systèmes à l'échelle planétaire. Il anticipe également une refonte du rapport humain-machine sur internet, estimant que la détection des bots est désormais un problème insoluble par voie algorithmique seule, et que seule une preuve cryptographique et biométrique d'identité humaine permettra de rétablir la confiance en ligne. Ses prises de position, portées par l'un des fonds les plus influents de la Silicon Valley, façonnent directement les priorités d'investissement de tout un écosystème.

LLMsOpinion
1 source
Guide visuel des variantes d'attention dans les LLM modernes
238Ahead of AI 

Guide visuel des variantes d'attention dans les LLM modernes

Sebastian Raschka vient de publier une ressource de référence inédite pour comprendre les architectures des grands modèles de langage : une galerie visuelle recensant 45 architectures de LLM, accompagnée d'un article de fond sur les variantes d'attention utilisées dans les modèles open-weight les plus récents. Une initiative qui comble un vide documentaire réel dans un domaine en évolution rapide. Le timing est révélateur : initialement prévu pour analyser DeepSeek V4, encore inédit à l'heure où ces lignes sont écrites, ce travail de deux semaines s'est transformé en un effort de consolidation plus ambitieux. Dans un écosystème où les architectures prolifèrent à un rythme soutenu, disposer d'une vue synthétique et visuellement claire devient un outil précieux aussi bien pour les chercheurs que pour les ingénieurs ML en entreprise. La galerie, accessible sur le site de Raschka, propose des cartes visuelles pour chaque architecture documentée, couvrant des concepts fondamentaux comme le Multi-Head Attention (MHA), mécanisme qui permet à chaque token d'agréger le contexte des autres tokens via plusieurs têtes d'attention parallèles, jusqu'aux variantes modernes comme le Grouped-Query Attention ou le Sliding Window Attention. Des modèles concrets comme GPT-2, OLMo 2 7B et OLMo 3 7B servent d'exemples d'implémentation. Une version poster imprimable a également été mise à disposition via Redbubble, testée en format Medium (26,9 × 23,4 pouces), avec une qualité jugée satisfaisante pour les éléments principaux. Au-delà de la galerie elle-même, l'article replace les mécanismes d'attention dans leur contexte historique : nés avant les transformers pour pallier les limites des RNN encodeur-décodeur en traduction automatique, incapables de mémoriser l'intégralité d'une séquence longue, ces mécanismes ont progressivement évolué pour devenir la colonne vertébrale de toute l'architecture moderne des LLM. Raschka annonce vouloir maintenir la galerie à jour au fil des nouvelles sorties, ce qui en fait potentiellement une ressource évolutive de premier plan.

LLMsTuto
1 source
239MarkTechPost 

L'équipe Qianfan de Baidu publie Qianfan-OCR : un modèle unifié d'intelligence documentaire à 4 milliards de paramètres

L'équipe Qianfan de Baidu vient de dévoiler Qianfan-OCR, un modèle de 4 milliards de paramètres capable de traiter intégralement la reconnaissance documentaire, parsing, analyse de mise en page et compréhension, au sein d'une architecture vision-langage unifiée. Contrairement aux pipelines OCR traditionnels qui enchaînent des modules séparés, le modèle effectue une conversion directe image-vers-Markdown et prend en charge des tâches pilotées par prompts, comme l'extraction de tableaux ou les questions-réponses sur documents. L'enjeu est considérable pour le secteur de l'intelligence documentaire, où les approches multi-étapes souffrent d'un défaut structurel : chaque étape introduit des pertes d'information, en particulier le contexte visuel spatial. Les systèmes en deux temps, extraction de texte puis LLM, échouent notamment sur les tâches nécessitant un raisonnement spatial : tous les systèmes pipeline testés ont obtenu un score de 0,0 sur les benchmarks CharXiv, incapables d'interpréter des graphiques dont les axes et positions de données ont été effacés lors de l'extraction. Sur le plan technique, Qianfan-OCR s'appuie sur un encodeur visuel Qianfan-ViT acceptant des images jusqu'en 4K (jusqu'à 4 096 tokens visuels par image), un adaptateur cross-modal léger, et le modèle de langage Qwen3-4B avec une fenêtre de contexte native de 32 000 tokens. Sa fonctionnalité phare, le mécanisme "Layout-as-Thought", déclenche une phase de réflexion structurée via des tokens `` pour reconstruire explicitement la mise en page avant de générer la réponse finale. Les résultats sont probants : 93,12 sur OmniDocBench v1.5 (devant DeepSeek-OCR-v2 à 91,09 et Gemini-3 Pro à 90,33), 880 sur OCRBench (premier toutes catégories), et une moyenne de 87,9 en extraction d'informations clés, surpassant des modèles bien plus grands comme Qwen3-VL-235B (84,2) ou Gemini-3.1-Pro (79,2). Côté déploiement, le modèle tourne sur un seul GPU NVIDIA A100 et atteint 1,024 pages par seconde avec quantification W8A8 (AWQ), soit un gain de vitesse de 2x par rapport à la baseline float16 sans perte significative de précision. Son architecture entièrement GPU-centrique élimine les goulots d'étranglement CPU propres aux pipelines hybrides, ce qui le rend particulièrement adapté à des inférences en large volume. Le modèle et le code sont disponibles en accès ouvert sur HuggingFace et arXiv.

OutilsActu
1 source
Tencent confirme un projet d'agent IA WeChat pour les "tâches pratiques
240The Information AI 

Tencent confirme un projet d'agent IA WeChat pour les "tâches pratiques

Tencent confirme officiellement son ambition de déployer un agent IA au sein de WeChat, la messagerie chinoise incontournable avec ses 1,3 milliard d'utilisateurs actifs. Martin Lau, président de Tencent, a annoncé que l'objectif est de créer un assistant capable de gérer un large éventail de tâches quotidiennes pratiques directement depuis l'application. L'enjeu est considérable : WeChat n'est pas une simple messagerie en Chine, c'est un super-app intégrant paiements, commerce, services gouvernementaux et vie sociale. Y intégrer un agent IA performant pourrait transformer radicalement l'expérience de centaines de millions d'utilisateurs et positionner Tencent comme acteur central de l'IA conversationnelle en Asie, face à la concurrence d'Alibaba, de Baidu et des nouveaux entrants comme DeepSeek. Martin Lau a formulé l'objectif ainsi : "Notre ambition pour l'avenir est de créer un agent IA" capable d'accomplir des tâches pratiques au quotidien, une déclaration qui confirme des informations rapportées en exclusivité par The Information. Tencent s'appuierait sur ses modèles Hunyuan, sa famille de LLMs développée en interne, pour alimenter cet agent. Cette annonce s'inscrit dans une course effrénée au sein de la Big Tech chinoise pour intégrer l'IA générative dans les plateformes à forte audience. L'intégration native dans WeChat, sans nécessiter d'application tierce, représenterait un avantage stratégique majeur en termes d'adoption, et pourrait servir de modèle pour d'autres super-apps à l'échelle mondiale.

OutilsOutil
1 source
Goldilocks RL : ajuster la difficulté des tâches pour contourner les récompenses éparses en raisonnement
241Apple Machine Learning 

Goldilocks RL : ajuster la difficulté des tâches pour contourner les récompenses éparses en raisonnement

Le renforcement par apprentissage (RL) s'impose comme l'une des voies les plus prometteuses pour développer les capacités de raisonnement des grands modèles de langage, mais il se heurte à un obstacle fondamental : la rareté des récompenses. Lorsque les signaux de feedback sont trop clairsemés, les modèles doivent explorer des espaces de recherche immenses avec très peu de guidance, rendant l'entraînement extrêmement inefficace. C'est précisément ce problème que la méthode Goldilocks RL cherche à résoudre. L'approche s'inscrit dans la tradition du curriculum learning, l'idée d'ordonner les données d'entraînement par niveau de complexité croissante, mais en pousse la logique bien plus loin. Plutôt que d'appliquer un ordre statique et générique, Goldilocks introduit un mécanisme dynamique piloté par un modèle « enseignant » qui prédit en temps réel la difficulté de chaque question pour le modèle élève en cours d'entraînement. L'enjeu est de toujours placer le modèle dans une zone d'apprentissage optimale : ni trop facile (aucun apprentissage), ni trop difficile (signal nul). La métaphore de Boucles d'or (Goldilocks) est donc délibérée : il s'agit de trouver la température idéale. Le modèle enseignant joue le rôle d'un orchestrateur adaptatif, sélectionnant dynamiquement les tâches dont la difficulté est calibrée pour maximiser le signal d'apprentissage malgré la rareté des récompenses. Cette stratégie d'échantillonnage évite les deux écueils classiques du RL sur les LLMs : le gaspillage computationnel sur des tâches triviales et l'absence de gradient sur des tâches hors de portée. La publication de Goldilocks RL s'inscrit dans une compétition intense autour de l'amélioration de l'efficacité du RL pour le raisonnement, après le succès de méthodes comme GRPO ou DAPO. Si la méthode tient ses promesses à plus grande échelle, elle pourrait réduire significativement les coûts d'entraînement des modèles de raisonnement avancés, un enjeu majeur pour les laboratoires cherchant à concurrencer les approches de OpenAI ou DeepSeek sans engager des ressources computationnelles massives.

RecherchePaper
1 source
Unsloth AI lance Unsloth Studio : une interface locale sans code pour l'affinage haute performance des LLM avec 70 % de VRAM en moins
242MarkTechPost 

Unsloth AI lance Unsloth Studio : une interface locale sans code pour l'affinage haute performance des LLM avec 70 % de VRAM en moins

Unsloth AI vient de franchir un cap décisif dans la démocratisation de l'affinage de modèles de langage avec le lancement d'Unsloth Studio, une interface locale sans code entièrement open-source. Conçue pour les ingénieurs et professionnels de l'IA, cette solution intègre l'ensemble du cycle d'affinage, préparation des données, entraînement, déploiement, dans un environnement Web unifié, sans nécessiter de configuration CUDA complexe ni de cluster multi-GPU. L'enjeu est considérable pour le secteur : l'affinage de grands modèles reste aujourd'hui l'apanage d'équipes disposant d'infrastructures coûteuses. En rendant cette opération accessible sur du matériel grand public, Unsloth Studio ouvre la porte à une nouvelle génération de développeurs indépendants, de chercheurs et de PME qui souhaitent personnaliser des modèles sans dépendre de services cloud facturés à l'usage. Au cœur de la solution se trouvent des kernels de rétropropagation écrits à la main en Triton, le langage de compilation GPU d'OpenAI, permettant un entraînement 2x plus rapide et une réduction de 70 % de l'utilisation de VRAM par rapport aux frameworks standards. Concrètement, des modèles de 8 à 70 milliards de paramètres, comme Llama 3.1, Llama 3.3 ou DeepSeek-R1, peuvent désormais être affinés sur un unique GPU de type RTX 4090 ou 5090, grâce aux techniques LoRA et QLoRA en quantification 4 ou 8 bits. La préparation des données est elle aussi automatisée via les Data Recipes, un workflow visuel à nœuds s'appuyant sur NVIDIA DataDesigner pour générer des jeux de données structurés depuis des fichiers bruts (PDF, DOCX, CSV). L'outil supporte également GRPO (Group Relative Policy Optimization), la technique de reinforcement learning popularisée par DeepSeek-R1, sans nécessiter de modèle Critic séparé. Le Studio prend en charge les architectures les plus récentes de début 2026, dont la série Llama 4 et Qwen 2.5/3.5, et propose un export en un clic vers les formats GGUF (inférence locale) et vLLM (serving haute performance), supprimant ainsi le dernier verrou entre l'entraînement et la mise en production.

OutilsOutil
1 source
Tencent prépare en secret un agent IA pour WeChat, que faut-il savoir ?
243Le Big Data 

Tencent prépare en secret un agent IA pour WeChat, que faut-il savoir ?

Tencent travaille en secret sur un agent d'intelligence artificielle intégré directement à WeChat, son application phare utilisée par 1,4 milliard d'utilisateurs actifs chaque mois. Selon The Information, qui cite plusieurs sources proches du dossier, ce projet aurait été lancé dès le premier semestre 2025 et est classé priorité stratégique confidentielle au sein du groupe. Les tests en boîte grise sont prévus pour le milieu de 2026, avec un déploiement général visé au troisième trimestre, calendrier susceptible de glisser si certaines fonctionnalités ne sont pas suffisamment matures. Côté modèle, aucune décision définitive n'a encore été prise : le modèle maison Hunyuan serait jugé insuffisamment compétitif face aux meilleurs du marché, et plusieurs alternatives chinoises ont été évaluées, dont celles de Zhipu, Alibaba et DeepSeek. L'infrastructure resterait centralisée sur les serveurs cloud de Tencent, les mini-programmes ne disposant pas des ressources locales nécessaires. L'enjeu est considérable : intégrer un agent IA dans WeChat, c'est potentiellement donner accès à un orchestrateur capable d'agir de façon autonome sur des millions de mini-programmes déjà en place, covoiturage, livraison de repas, paiement, services publics. Là où une application IA indépendante doit se battre pour attirer des utilisateurs, WeChat bénéficie d'une audience captive et d'un écosystème construit depuis 2017. La difficulté est symétrique : toute défaillance sur une plateforme aussi critique serait immédiatement visible par des centaines de millions de personnes. C'est précisément pourquoi Tencent avance prudemment, ayant tiré les leçons du lancement tiède de son appli IA autonome Yuanbao en mai 2024, qui n'a pas réussi à s'imposer face à la concurrence. Ce projet s'inscrit dans une bataille plus large pour le contrôle de la couche agent en Chine. Alibaba et ByteDance poursuivent des initiatives similaires, et Tencent ne peut pas rester spectateur dans cette course sans risquer de voir son écosystème WeChat contourné par des assistants tiers. En mars 2026, l'entreprise a déjà présenté trois nouveaux produits reposant sur des agents intelligents, QClaw pour les particuliers, Enterprise WeChat Robot pour les équipes et WorkBuddy pour les environnements professionnels, signalant une accélération de sa stratégie IA tous azimuts. L'agent WeChat représenterait la pièce maîtresse de ce dispositif : la vitrine grand public d'une infrastructure IA que Tencent construit en profondeur, et potentiellement le premier superagent intégré à une messagerie de cette échelle au monde.

OutilsOutil
1 source