Aller au contenu principal

Dossier DeepSeek — page 4

243 articles · page 4 sur 5

DeepSeek, le laboratoire chinois qui a secoué les valeurs tech US : modèles open-weight V3, R1, V4, économie du compute et géopolitique de l'IA.

Gigatoken : un tokeniseur BPE en Rust qui encode le texte à 24,53 Go/s, jusqu'à 989 fois plus vite que HuggingFace Tokenizers
151MarkTechPost OutilsOutil

Gigatoken : un tokeniseur BPE en Rust qui encode le texte à 24,53 Go/s, jusqu'à 989 fois plus vite que HuggingFace Tokenizers

Marcel Rød, doctorant à Stanford, a publié Gigatoken, un tokenizer BPE (byte-pair encoding) écrit en Rust sous licence MIT, capable d'encoder du texte à 24,53 Go/s sur une seule machine. Le benchmark de référence, réalisé avec le tokenizer GPT-2 sur le corpus owt_train.txt de 11,9 Go et une machine bi-socket AMD EPYC 9565 à 144 cœurs, place Gigatoken loin devant ses concurrents : tiktoken d'OpenAI atteint 36,0 Mo/s et HuggingFace Tokenizers 24,8 Mo/s sur le même matériel, soit des écarts de 681 fois et 989 fois. Sur un Apple M4 Max à 16 cœurs, Gigatoken traite le même corpus à 8,79 Go/s (1268 fois plus vite que HuggingFace, 140 fois plus vite que tiktoken), et sur un AMD Ryzen 7 9800X3D grand public, 6,27 Go/s, soit 106 et 68 fois plus rapide. La bibliothèque, disponible sur PyPI en version 0.9.0 depuis le 21 juillet 2026 via pip install gigatoken, couvre 23 familles de tokenizers dont GPT-2, GPT-OSS, Llama 3 à 4, Qwen 2 à 3.6, DeepSeek V3/R1/V4, GLM 4 et 5, Kimi K2, Nemotron 3, Phi-4, OLMo 2/3, ModernBERT, Gemma et Mistral. Cette performance change la donne pour un maillon de la chaîne d'entraînement des modèles de langage rarement optimisé, alors même qu'il conditionne la vitesse de préparation des jeux de données massifs utilisés pour l'entraînement des LLM. Un tokenizer 989 fois plus rapide réduit drastiquement le temps et le coût de calcul nécessaires pour préparer des corpus de plusieurs téraoctets, une étape jusqu'ici considérée comme un goulot d'étranglement secondaire face à l'entraînement lui-même. Gigatoken propose deux modes d'utilisation : un mode de compatibilité qui encapsule un tokenizer HuggingFace ou tiktoken existant en préservant une parité exacte des résultats, mais avec un gain plus modeste de 200 à 300 fois selon Marcel Rød en raison du surcoût lié à Python, et une API native en Rust qui lit directement les fichiers et produit les chiffres records annoncés. Les gains ne proviennent pas d'une amélioration de la boucle de fusion BPE elle-même, mais de deux optimisations généralement négligées. La première concerne la prétokenisation : la plupart des implémentations délèguent cette étape à un moteur d'expressions régulières, quand Gigatoken utilise une machine à états écrite à la main. Le journal d'optimisation du projet détaille une progression méthodique, d'une base en fancy-regex à environ 47 Mio/s jusqu'à 1049 Mio/s en mono-thread, en passant par une table de correspondance de 256 octets pour un dispatch en temps constant, la technique SWAR (SIMD Within A Register) traitant huit octets à la fois sans intrinsèques spécifiques à une architecture, puis une exploitation du parallélisme d'instructions via deux curseurs indépendants qui exploite les ports d'exécution inactifs du processeur. Au total, cette seule optimisation de la prétokenisation représente un gain de 22,3 fois par rapport à l'implémentation par expressions régulières. La seconde optimisation repose sur la mise en cache des pré-tokens déjà rencontrés, une technique que Marcel Rød décrit comme délicate à implémenter en pratique en raison de la croissance rapide du cache et de la distribution à longue traîne des mots, le tout combiné à une minimisation des interactions entre Python et les threads.

1 source
Analyse d'EdgeBench de qualité recherche : benchmarking d'agents IA, classements, lois d'échelle et métriques d'évaluation
152MarkTechPost 

Analyse d'EdgeBench de qualité recherche : benchmarking d'agents IA, classements, lois d'échelle et métriques d'évaluation

EdgeBench, un benchmark publié par ByteDance-Seed sur Hugging Face, permet d'évaluer les agents d'intelligence artificielle avancés sur des tâches variées, dans différents environnements d'exécution et avec plusieurs budgets de temps d'interaction. Un tutoriel technique récent détaille comment exploiter ce jeu de données : après le téléchargement du snapshot complet depuis le dépôt Hugging Face ByteDance-Seed/EdgeBench, les spécifications de chaque tâche sont extraites au format JSON et rassemblées dans un tableau structuré comprenant la catégorie, l'image de base d'exécution, le besoin ou non d'accès internet, le mode de jeu éventuel, ainsi que la logique de notation du juge et son mode de recalibrage des scores. Le classement des modèles est ensuite récupéré directement depuis le README du dépôt, avec cinq systèmes comparés : Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 et DS-V4-Pro. Les résultats sont analysés sur six budgets de temps différents, allant de 2 à 12 minutes par tâche, permettant de retracer une véritable courbe de progression de performance selon le temps alloué à chaque agent. Cette approche méthodique compte pour l'écosystème de l'évaluation des agents IA, un domaine encore jeune où les benchmarks existants peinent souvent à distinguer la performance réelle en environnement réaliste de la simple capacité à répondre à des questions isolées. En modélisant les scores selon des courbes de type sigmoïde logarithmique, les chercheurs peuvent quantifier précisément à quelle vitesse un modèle progresse lorsqu'on lui accorde plus de temps de réflexion et d'action, une information cruciale pour les entreprises qui déploient des agents autonomes dans des contextes où le temps de calcul a un coût direct. L'identification des catégories de tâches où les gains de score sont les plus importants aide également les développeurs de modèles à cibler leurs efforts d'amélioration, tandis que la transparence sur les fonctions de recalibrage, appelées SForge dans ce benchmark, permet de comprendre comment les scores bruts sont transformés en notes normalisées comparables entre tâches très hétérogènes. Ce travail s'inscrit dans une tendance plus large de sophistication des méthodes de benchmarking pour les agents IA, à mesure que des laboratoires comme Anthropic, OpenAI, Zhipu AI (GLM) ou DeepSeek publient des versions de plus en plus capables de leurs modèles phares. Les benchmarks classiques, souvent statiques et binaires, cèdent la place à des évaluations dynamiques prenant en compte le budget de calcul, la diversité des environnements d'exécution et la nécessité d'un accès réseau réel. ByteDance, via sa division Seed dédiée à la recherche fondamentale en IA, s'ajoute ainsi à la liste des grands acteurs technologiques investissant dans des outils d'analyse ouverts, disponibles sur Hugging Face pour la communauté. Les prochaines étapes attendues incluent l'élargissement du nombre de tâches couvertes et l'intégration de nouveaux modèles au fur et à mesure de leur sortie, afin de maintenir ce type de classement à jour face au rythme effréné des publications dans le secteur.

LLMsPaper
1 source
Contrôler l'effort de raisonnement dans les LLM
153Ahead of AI 

Contrôler l'effort de raisonnement dans les LLM

Voici l'article traduit et résumé : Le 26 juin dernier, OpenAI a lancé la famille de modèles GPT-5.6, disponible en trois tailles, chacune proposant entre cinq et six niveaux d'effort de raisonnement configurables. Cette annonce intervient près de deux ans après le lancement d'o1 par OpenAI, qui avait popularisé les modèles de raisonnement basés sur les LLM, et environ quatre mois après DeepSeek-R1, qui avait détaillé une méthode d'apprentissage par renforcement à récompenses vérifiables (RLVR) pour entraîner ce type de modèles. Sebastian Raschka, chercheur reconnu dans le domaine, souligne dans son analyse que les modèles de raisonnement sont désormais devenus un standard incontournable de toute nouvelle génération de modèles. Il rappelle le principe central du RLVR popularisé par DeepSeek-R1 : fournir un signal de récompense binaire, zéro pour une réponse incorrecte, un pour une réponse correcte, uniquement sur des domaines vérifiables comme les mathématiques, via des outils comme SymPy ou WolframAlpha, ou le code, via des compilateurs et des tests unitaires. Fait notable, la trace de raisonnement intermédiaire elle-même n'est pas utilisée pour l'entraînement du modèle : seule la réponse finale et le respect du format comptent pour le calcul de la récompense. Cette généralisation des modes d'effort configurables change concrètement la manière dont les entreprises et les développeurs peuvent exploiter ces modèles. Plutôt que de choisir entre un modèle rapide et peu coûteux ou un modèle lent et performant, les utilisateurs peuvent désormais ajuster finement le curseur entre vitesse d'exécution et qualité de raisonnement selon la tâche à accomplir, un simple résumé de texte ne nécessitant pas le même effort qu'un problème mathématique complexe. Pour l'industrie, cela signifie une meilleure maîtrise des coûts de calcul et une adaptation plus fine des modèles aux usages professionnels réels, où toutes les requêtes n'exigent pas le même niveau de sophistication. C'est aussi le signe que la recherche sur le raisonnement des LLM a atteint une maturité suffisante pour passer d'une simple option binaire, raisonnement activé ou non, à un curseur continu de performance. Cette évolution s'inscrit dans un contexte de recherche particulièrement actif depuis la publication de DeepSeek-R1. Deux grandes approches permettent aujourd'hui d'améliorer les capacités de résolution de problèmes des modèles de raisonnement : l'optimisation à l'entraînement et l'optimisation à l'inférence, c'est-à-dire au moment de l'exécution. La question de savoir comment exploiter la trace de raisonnement intermédiaire pour améliorer l'entraînement, notamment via des modèles de récompense de processus, reste un sujet de recherche actif et non résolu. Raschka, auteur d'un livre de 440 pages intitulé Build A Reasoning Model (From Scratch), consacré à la construction de modèles de raisonnement à partir de zéro, prévoit que la prochaine étape naturelle de cette recherche portera sur le développement de modèles capables de moduler nativement leur propre effort de raisonnement selon la complexité de la tâche, plutôt que de dépendre uniquement de réglages externes fixés par l'utilisateur.

💬 Ce qui compte dans GPT-5.6, c'est pas le modèle, c'est le curseur : cinq ou six crans d'effort, ça veut dire qu'OpenAI admet enfin que le raisonnement a un prix et qu'il faut le doser comme du café. Bon, sur le papier ça sonne comme du réglage fin pour les entreprises qui veulent économiser du calcul, mais en vrai ça acte surtout que le mode "réfléchir" à deux vitesses d'il y a deux ans était un hack grossier. Reste à voir si les modèles apprendront un jour à choisir eux-mêmes leur effort, parce que pour l'instant c'est encore à l'utilisateur de deviner combien de réflexion vaut sa question.

LLMsOpinion
1 source
Thinking Machines Lab lance Inkling, un modèle multimodal MoE open-weights de 975 milliards de paramètres (41 milliards actifs) à effort de raisonnement ajustable
154MarkTechPost 

Thinking Machines Lab lance Inkling, un modèle multimodal MoE open-weights de 975 milliards de paramètres (41 milliards actifs) à effort de raisonnement ajustable

Thinking Machines Lab vient de publier Inkling, son premier modèle entraîné entièrement en interne, avec des poids ouverts et un réglage fin possible via sa plateforme Tinker. Il s'agit d'un transformeur à mélange d'experts (MoE) comptant 975 milliards de paramètres au total, dont 41 milliards actifs, doté d'une fenêtre de contexte pouvant atteindre 1 million de tokens. Le préentraînement a porté sur 45 000 milliards de tokens mêlant texte, images, audio et vidéo ; le modèle accepte du texte, des images et de l'audio en entrée, mais ne produit que du texte en sortie. Le laboratoire a également dévoilé Inkling Small, une version de 276 milliards de paramètres avec 12 milliards actifs, qui égale voire dépasse son grand frère sur de nombreux benchmarks ; ses poids seront publiés une fois les tests terminés. L'architecture, proche de celle de DeepSeek V3, comprend 66 couches de décodeur avec 256 experts routés et 2 experts partagés par couche MoE, six experts routés s'activant par token via un routeur à base de sigmoïde. Le modèle alterne couches d'attention locale et globale selon un ratio de 5 pour 1, utilise un encodage positionnel relatif plutôt que RoPE, et a été entraîné avec l'optimiseur Muon sur des systèmes NVIDIA GB300 NVL72, avec un post-entraînement basé sur du SFT synthétique (notamment généré par Kimi K2.5) suivi d'un apprentissage par renforcement asynchrone dépassant 30 millions de déploiements. L'innovation la plus notable concerne le contrôle de l'effort de raisonnement : durant l'entraînement RL, l'équipe a fait varier le budget de tokens alloué au modèle en ajustant le message système et le coût par token, si bien qu'Inkling a appris à moduler lui-même sa profondeur de réflexion selon la tâche. Ce curseur, réglable de 0,2 à 0,99, est directement exposé via un paramètre reasoning_effort dans la bibliothèque transformers, ce qui permet aux développeurs d'ajuster coût et latence à la demande plutôt que de choisir entre plusieurs modèles figés. Concrètement, Inkling consomme trois fois moins de tokens que Nemotron 3 Ultra pour une performance équivalente sur Terminal Bench 2.1, un gain d'efficacité qui pourrait peser lourd pour les entreprises déployant des agents à grande échelle. Sur les benchmarks, évalués à effort maximal (0,99), Inkling se montre compétitif face à des modèles ouverts comme Kimi K2.6, GLM 5.2 ou DeepSeek V4 Pro, dominant notamment le test d'adversarialité FORTRESS avec 78 %, mais accusant un retard de près de 19 points sur GLM 5.2 en Terminal Bench 2.1. Il affiche aussi 73,5 % sur MMMU Pro et 91,4 % sur VoiceBench. Ce lancement s'inscrit dans la course des laboratoires d'IA à proposer des modèles open-weights toujours plus personnalisables, où Thinking Machines Lab, fondé par d'anciens cadres d'OpenAI, mise sur la finesse de réglage et la maîtrise du coût de calcul comme argument différenciant face aux géants du secteur.

💬 Le vrai coup ici c'est le curseur reasoning_effort, pas la taille du modèle. Thinking Machines Lab remplace le choix entre plusieurs modèles figés par un seul réglage de profondeur de réflexion, ajustable à la volée, et trois fois moins de tokens que Nemotron 3 Ultra pour la même perf sur Terminal Bench, ça pèse lourd sur la facture des boîtes qui font tourner des agents à grande échelle. Reste que sur ce même benchmark il traîne 19 points derrière GLM 5.2, donc l'efficacité ne rattrape pas encore un vrai écart de capacité.

LLMsActu
1 source
Robbyant lance LingBot-VLA 2.0, un modèle VLA open source de 6 milliards de paramètres pour la manipulation robotique multi-morphologies
155MarkTechPost 

Robbyant lance LingBot-VLA 2.0, un modèle VLA open source de 6 milliards de paramètres pour la manipulation robotique multi-morphologies

Robbyant, filiale d'Ant Group, a publié LingBot-VLA 2.0, un modèle fondation de type Vision-Language-Action (VLA) destiné au contrôle de robots, accompagné d'un rapport technique, d'un code source sous licence Apache-2.0 et d'un checkpoint de 6 milliards de paramètres. Ce modèle, baptisé lingbot-vla-v2-6b, s'appuie sur Qwen3-VL-4B-Instruct comme backbone vision-langage et convertit des images de caméra ainsi qu'une instruction textuelle en commandes robotiques concrètes. Deux modèles enseignants, LingBot-Depth et DINO-Video, supervisent l'entraînement par distillation. Sur une carte graphique NVIDIA GeForce RTX 4090D, une inférence prend environ 130 millisecondes avec 10 étapes de débruitage. L'entraînement s'appuie sur environ 60 000 heures de données, dont 50 000 heures de trajectoires robotiques couvrant 20 configurations différentes, du bras unique à l'humanoïde complet, et 10 000 heures de vidéos égocentriques humaines, issues d'un pool brut de 90 000 et 20 000 heures respectivement, filtré par un pipeline qui élimine les échantillons bruités via des scores de secousse, vitesse et accélération. L'annotation des sous-tâches repose sur le modèle Qwen3.6-27B, qui segmente chaque vidéo selon un vocabulaire fermé de 18 catégories d'actions. L'enjeu central visé par Robbyant est de combler l'écart persistant entre les performances des modèles VLA en laboratoire et leurs limites en déploiement réel, un problème récurrent qui freine l'adoption industrielle de la robotique généraliste. En unifiant la représentation des actions dans un vecteur canonique de 55 dimensions, couvrant bras, effecteurs, mains, poignets, tête et base mobile, LingBot-VLA 2.0 permet à un seul modèle de piloter des architectures robotiques très différentes sans réentraînement spécifique. Cette approche pourrait accélérer le déploiement de robots polyvalents dans l'industrie et la logistique, en réduisant les coûts de développement liés à la création d'un modèle par type de robot. L'ouverture du code sous licence permissive vise aussi à stimuler la recherche communautaire sur les modèles VLA multi-embodiment. Le choix d'une architecture Mixture-of-Experts pour l'expert d'action, inspirée des mécanismes de routage sans perte d'équilibrage introduits par DeepSeek-V3, s'inscrit dans une tendance plus large de la recherche en IA visant à augmenter la capacité des modèles sans alourdir le calcul actif. À paramètres actifs équivalents, cette architecture MoE surpasse un modèle dense de référence sur les tâches du benchmark GM-100. LingBot-VLA 2.0 introduit également une distillation à double requête, avec des jetons apprenants ciblant l'observation présente et une observation future, pour anticiper la dynamique du monde plutôt que réagir seulement à l'instant présent. Ces choix technique reflètent la compétition croissante entre laboratoires chinois et occidentaux sur la robotique générale fondée sur des modèles fondation, un terrain où Ant Group cherche désormais à s'imposer aux côtés d'acteurs comme Figure, Physical Intelligence ou Google DeepMind.

💬 C'est le pattern qu'on va voir se répéter partout en robotique cette année : un seul modèle qui pilote bras, mains et humanoïde sans réentraînement par machine. Un vecteur d'action unifié à 55 dimensions, ça règle enfin le vrai problème, celui de devoir refaire un modèle à chaque nouveau robot. Reste que 130ms d'inférence sur une RTX 4090D, c'est loin d'être garanti stable en usine, et Ant Group arrive tard face à Figure ou Physical Intelligence sur ce terrain.

RobotiqueActu
1 source
Anthropic relance Claude Fable 5 avec des garde-fous de sécurité renforcés
156Latent Space 

Anthropic relance Claude Fable 5 avec des garde-fous de sécurité renforcés

Anthropic a relancé Claude Fable 5 le 1er juillet 2026, après une journée d'indisponibilité qui avait provoqué une forte demande contenue chez les utilisateurs. L'entreprise a précisé que certaines requêtes, notamment liées à la cybersécurité, pourraient désormais être redirigées vers Opus 4.8 en raison de nouveaux garde-fous, et que les classificateurs de sécurité biologie/chimie restent pour l'instant trop larges dans leur détection. Les limites de débit (rate limits) ont été réinitialisées pour tous les utilisateurs une fois le modèle de nouveau disponible. L'écosystème d'outils a immédiatement intégré ce retour : Cursor indique que Fable 5 domine ses évaluations internes mais reste le modèle le plus coûteux par tâche, Devin l'a déployé sur ses versions Cloud, Desktop et CLI, et Perplexity l'a rétabli comme modèle d'orchestration. Sur le plan des benchmarks, Fable 5 obtient 16,10% sur le Remote Labor Index selon les données relayées par kimmonismus, tandis qu'Artificial Analysis situe Sonnet 5 en deuxième position sur AA-Briefcase, avec toutefois davantage de tours d'échange et un rapport coût-performance moins favorable aux niveaux d'effort les plus bas. Le fait marquant n'est pas tant le retour du modèle que la manière dont les développeurs s'adaptent aux contraintes des modèles de pointe. Plusieurs d'entre eux, dont l'utilisateur Theo, décrivent désormais une architecture multi-modèles plutôt qu'une dépendance à un seul système : Fable 5 est réservé au raisonnement et à la planification de haut niveau, tandis que l'implémentation, la vérification et les tâches d'usage d'ordinateur sont déléguées à d'autres modèles, ce qui améliorerait sensiblement le taux de succès des pull requests de bout en bout. Omar Sar et Mikhail Parakhin partagent une analyse proche : plutôt que de construire un pré-classificateur de tâches simples pour router les requêtes, mieux vaut concevoir directement des stratégies combinant plusieurs modèles, car un routage fiable exige souvent d'avoir déjà résolu la tâche elle-même. Cette évolution reflète une maturation du marché des agents de code, où la robustesse prime désormais sur la dépendance à un fournisseur unique. En parallèle, le laboratoire chinois Z.ai a lancé ZCode, un environnement de développement officiel dédié à son modèle ouvert GLM-5.2, avec prise en charge du BYOK (bring your own key), disponibilité multiplateforme et un quota de requêtes renforcé pour les abonnés à son offre de codage. LangChain a publié des guides d'intégration de GLM-5.2 dans des flux de code, et son fondateur Harrison Chase note que des développeurs en font déjà leur modèle quotidien. Sur le benchmark APEX-SWE, GLM-5.2 devient le premier modèle ouvert à dominer une catégorie, avec 55,3% de réussite au premier essai sur les tâches d'intégration, Kimi K2.7 le suivant de près ; des voix comme scaling01 tempèrent néanmoins l'idée que les modèles ouverts auraient dépassé les modèles occidentaux, tout en reconnaissant un écart de performance en code qui se réduit rapidement. Côté infrastructure, vLLM a intégré le décodage spéculatif DSpark pour les modèles DeepSeek, atteignant environ 250 tokens par seconde sur huit GPU B300, et des accélérations comparables ont été rapportées pour GLM-5.2 et Qwen3-32B, signe que la course à l'inférence rapide s'intensifie autant que celle des capacités.

💬 Le retour de Fable 5, je m'en fiche un peu, ce qui compte c'est ce que la panne a révélé : plus personne de sérieux ne mise tout sur un seul modèle. Fable 5 pour réfléchir, un autre pour coder, un troisième pour vérifier, c'est déjà la norme chez les devs qui livrent en prod, et ça fait grimper le taux de succès des pull requests. Le fantasme du routage automatique intelligent, lui, en prend un coup : comme le dit Omar Sar, pour router une tâche il faut déjà l'avoir résolue soi-même.

LLMsActu
1 source
Les logiciels d'inférence NVIDIA permettent le coût par token le plus bas
157NVIDIA AI Blog 

Les logiciels d'inférence NVIDIA permettent le coût par token le plus bas

NVIDIA vient de publier une analyse détaillée de la façon dont sa pile logicielle d'inférence réduit le coût par token pour les entreprises qui déploient des modèles d'IA en production. Sur la plateforme Blackwell, cette pile logicielle a déjà permis de réduire le coût des tokens jusqu'à 5 fois sur le modèle DeepSeek V4 en l'espace d'un seul mois. Des acteurs majeurs de l'inférence l'utilisent déjà à grande échelle : Baseten a utilisé la bibliothèque open source TensorRT-LLM de NVIDIA pour servir DeepSeek V4 Pro sur des GPU Blackwell, obtenant jusqu'à 50 % de tokens par seconde supplémentaires. Cognition s'appuie sur le framework Dynamo pour orchestrer ses GPU d'inférence et scaler ses charges de travail de reinforcement learning sans devoir construire cette infrastructure depuis zéro. Together AI a utilisé TensorRT-LLM pour aider Cursor à accélérer le chemin entre optimisations de modèles et endpoints de production pour son expérience de code en temps réel. Ce qui est en jeu dépasse la simple performance brute. Là où les charges de travail web traditionnelles suivaient des chemins logiciels prévisibles, l'IA agentique génère des workflows distribués et à état persistant qui mobilisent simultanément des LLM, des outils, de la mémoire et des centaines de sous-agents sur des GPU, CPU et systèmes de stockage hétérogènes. Une seule requête utilisateur peut se transformer en un problème de calcul distribué couvrant des milliers de tâches. Dans ce contexte, le logiciel devient le facteur déterminant : c'est lui qui transforme la complexité en coût maîtrisé ou, à défaut, en capacité gaspillée. NVIDIA affirme que l'empilement de ses optimisations, serving disaggregé, parallélisme d'experts sur NVLink, précision NVFP4 et prédiction multi-token, peut multiplier le débit par 20 lorsqu'elles sont combinées en système cohérent. La stratégie de NVIDIA repose sur trois couches intégrées : l'orchestration de la production (serving distribué, autoscaling, gestion mémoire), l'accélération applicative (fusion de kernels, chevauchement calcul-communication) et l'accès matériel abstrait (exposer les capacités GPU et réseau sans que les développeurs aient à gérer chaque instruction bas niveau). Ce modèle de co-conception logiciel-matériel est au coeur de la thèse défendue par NVIDIA face à la concurrence croissante des TPU de Google ou des puces custom d'Amazon et Microsoft. Alors que les entreprises basculent de pilotes IA vers de véritables usines de tokens à grande échelle, la capacité à améliorer continûment le coût par token via des mises à jour logicielles, sans changer le matériel, devient un avantage compétitif structurel. Les résultats publiés par SemiAnalysis InferenceX sur les systèmes GB300 NVL72 avec SGLang et Dynamo illustrent que cet écart se creuse déjà.

💬 Ce qui me frappe ce n'est pas le x5 sur DeepSeek V4, c'est que NVIDIA gagne maintenant sa bataille après la vente du GPU. Le vrai avantage compétitif, c'est de pouvoir baisser le coût par token via une mise à jour logicielle, sans toucher au matériel : ça change la donne face aux TPU de Google ou aux puces maison d'Amazon. Reste que le x20 annoncé empile plein d'optimisations testées en labo, faudra voir ce que ça donne sur de vraies charges agentiques avec des milliers de sous-agents qui tournent en même temps.

InfrastructureActu
1 source
Données d'affinage supervisé avec NVIDIA Open-SWE-Traces : trajectoires, patches, budgets de tokens et métriques d'outils
158MarkTechPost 

Données d'affinage supervisé avec NVIDIA Open-SWE-Traces : trajectoires, patches, budgets de tokens et métriques d'outils

NVIDIA a publié Open-SWE-Traces, un jeu de données disponible sur Hugging Face regroupant des trajectoires complètes d'agents IA en train de résoudre des tâches de programmation logicielle. Un tutoriel détaillé, publié récemment, guide les praticiens à travers l'exploitation de ce corpus pour construire des données d'entraînement supervisé. Le pipeline décrit charge les données en streaming depuis Hugging Face pour éviter un téléchargement complet, inspecte les enregistrements individuels, normalise les conversations multi-tours entre agents et environnements, extrait les patches de code produits, et génère un DataFrame analytique. Les agents étudiés sont OpenHands et SWE-Agent, fonctionnant sur des modèles comme Qwen 3.5 122B et Minimax M25, avec un filtre de 32 000 tokens maximum par trajectoire retenue pour le fine-tuning. Ce travail répond à un besoin concret de l'industrie : entraîner des agents capables de résoudre des bugs et d'écrire du code de manière autonome, un segment en pleine effervescence depuis l'émergence des coding agents. Les trajectoires retenues pour le fine-tuning supervisé ne conservent que les épisodes marqués comme résolus avec succès, disposant d'un patch valide et respectant les contraintes de longueur en tokens. Cette approche de filtrage qualité est directement applicable à la création de modèles spécialisés en ingénierie logicielle, et les métriques extraites, taux de résolution, distribution des langages, taille des patches, fréquence des appels d'outils, permettent de diagnostiquer quelles trajectoires produisent réellement des agents fiables plutôt que des agents qui semblent fonctionner. Open-SWE-Traces s'inscrit dans une dynamique plus large autour des benchmarks de coding agents, notamment SWE-bench, qui évalue la capacité des modèles à corriger des bugs issus de vrais dépôts GitHub. NVIDIA positionne ce dataset comme une ressource ouverte pour accélérer la recherche sur les agents logiciels, dans un contexte où les grandes entreprises comme Anthropic, Google et OpenAI rivalisent sur la capacité de leurs modèles à automatiser des tâches de développement. La disponibilité de trajectoires brutes avec métadonnées détaillées, rôles des messages, appels d'outils, résultats d'exécution, est rare et précieuse : la plupart des corpus publics existants ne livrent que les entrées et sorties finales, sans le raisonnement intermédiaire de l'agent. La prochaine étape naturelle pour les équipes qui s'en emparent sera d'utiliser ce fine-tuning supervisé comme point de départ avant un entraînement par renforcement, suivant la trajectoire désormais établie par des modèles comme DeepSeek-R1.

UELes équipes européennes de recherche et les startups travaillant sur les agents de code peuvent exploiter directement ce dataset hébergé sur HuggingFace pour accélérer leurs travaux de fine-tuning supervisé, sans coût d'accès supplémentaire.

RecherchePaper
1 source
Baidu lance Unlimited OCR, un modèle 3B qui stabilise le cache KV pour l'analyse de longs documents
159MarkTechPost 

Baidu lance Unlimited OCR, un modèle 3B qui stabilise le cache KV pour l'analyse de longs documents

Baidu a publié Unlimited OCR, un modèle de reconnaissance optique de caractères de 3 milliards de paramètres conçu pour analyser des documents longs sans que les performances ne se dégradent. Basé sur DeepSeek OCR par continue-training plutôt que par un entraînement from scratch, il adopte une architecture Mixture-of-Experts qui n'active que 500 millions de paramètres en inférence. Sur le benchmark OmniDocBench v1.5, il obtient un score de 93,23 points, soit 6,22 points de mieux que la référence DeepSeek OCR. Le modèle traite des dizaines de pages en une seule passe, dans une fenêtre maximale de 32 000 tokens, grâce notamment à un encodeur visuel qui compresse les images : une page PDF de 1024x1024 pixels est réduite à seulement 256 tokens visuels avant d'atteindre le décodeur. Le problème central que résout Unlimited OCR est celui de la mémoire croissante dans les systèmes OCR traditionnels. Dans les modèles classiques, chaque token généré s'ajoute au KV cache, ce qui fait grossir la mémoire et ralentir la génération au fur et à mesure que le document s'allonge. Baidu remplace l'attention standard du décodeur par une architecture baptisée Reference Sliding Window Attention (R-SWA), qui maintient le cache à une taille fixe. Chaque nouveau token généré s'appuie sur tous les tokens visuels de référence, plus seulement les 128 derniers tokens produits, les autres étant évincés. La taille du cache devient ainsi bornée par une constante, indépendamment de la longueur de la sortie. Cette approche évite aussi le flou progressif observé dans les architectures à attention linéaire, car les tokens visuels ne subissent aucune mise à jour d'état. Derrière cette publication, Baidu s'inscrit dans une compétition technique autour du traitement de documents à grande échelle, un marché stratégique pour les entreprises manipulant des contrats, des factures ou des archives volumineuses. L'OCR long-document est un goulot d'étranglement réel dans les pipelines RAG et d'automatisation documentaire, et plusieurs laboratoires cherchent à le lever. La solution R-SWA rappelle la métaphore d'un copiste qui consulte la source et les quelques derniers mots écrits, sans relire l'intégralité de ce qu'il a déjà transcrit. Unlimited OCR supporte deux modes de résolution : un mode "Base" à 1024x1024 pour le traitement multi-pages, et un mode "Gundam" en résolution dynamique pour les pages individuelles. Le modèle et son papier de recherche sont disponibles publiquement via arXiv, ce qui ouvre la voie à des adaptations et à une adoption dans des pipelines open-source.

OutilsOpinion
1 source
Qwen-AgentWorld : le simulateur d’Alibaba apprend aux agents IA à mieux réfléchir
160Le Big Data 

Qwen-AgentWorld : le simulateur d’Alibaba apprend aux agents IA à mieux réfléchir

Le laboratoire d'IA Qwen, filiale d'Alibaba, a dévoilé le 24 juin 2026 un système baptisé Qwen-AgentWorld : un simulateur capable de reproduire sept environnements numériques distincts au sein d'un seul modèle, couvrant le terminal, le moteur de recherche, le protocole MCP, le développement logiciel, le navigateur web, le système d'exploitation et Android. Contrairement aux approches classiques, la modélisation de l'environnement constitue l'objectif d'entraînement central du modèle, et non une couche ajoutée après coup. Le système a été entraîné sur plus de dix millions de trajectoires d'interactions réelles. Alibaba publie également AgentWorldBench, un benchmark interne couvrant les sept domaines simulés, sur lequel le modèle Qwen-AgentWorld-397B-A17B obtient les meilleurs scores globaux, devançant GPT-5.4, Claude Opus 4.8, Gemini 3.1 Pro, DeepSeek V4-Pro et Qwen3-6P Plus. L'intérêt de l'approche tient à ce qu'elle permet aux agents de s'exercer dans un environnement entièrement maîtrisé avant d'affronter des tâches réelles, à la manière d'un simulateur de vol. Les scénarios deviennent reproductibles, les erreurs sont peu coûteuses et les situations rares peuvent être générées à la demande. Les chercheurs d'Alibaba montrent également que l'apprentissage de la prédiction des états améliore les performances des agents même sans entraînement spécifique sur certaines tâches, et que cette capacité se transfère vers différents benchmarks sans ajustement supplémentaire. Pour les interfaces graphiques, le modèle adopte une représentation textuelle des écrans, sous forme de code HTML ou d'arbres XML plutôt que d'images brutes, ce qui simplifie l'entraînement et renforce le raisonnement sur des interfaces complexes. Pendant des années, les agents IA ont été entraînés comme de simples modèles de langage auxquels on greffait ensuite des capacités d'action sur des outils ou des logiciels, une méthode efficace mais limitée dès que l'environnement gagne en complexité. Alibaba mise ici sur un changement de paradigme : faire de la compréhension du monde numérique un prérequis à l'action, et non une compétence dérivée. Cette direction rejoint un débat plus large dans la recherche sur les agents autonomes, où les acteurs comme Google, Anthropic, OpenAI et des laboratoires chinois tels que DeepSeek se disputent la maîtrise des agents capables d'opérer des ordinateurs en autonomie. Les résultats présentés par Alibaba restent toutefois à interpréter avec prudence : un benchmark interne, aussi soigné soit-il, ne remplace pas des évaluations indépendantes sur des usages réels, et les prochains mois permettront de mesurer si cette approche tient ses promesses en conditions de production.

UEL'émergence d'un simulateur d'entraînement multi-environnements développé par un laboratoire chinois majeur intensifie la compétition mondiale sur les agents autonomes, sans impact réglementaire ou opérationnel direct pour la France ou l'UE.

💬 L'idée est simple mais personne ne l'avait vraiment poussée jusqu'au bout : entraîner un agent à comprendre son environnement avant de lui demander d'agir dedans, plutôt que de greffer des capacités d'action sur un LLM qui ne "voit" pas vraiment le monde numérique dans lequel il opère. Alibaba a mis 10 millions de trajectoires réelles dans un simulateur qui couvre terminal, navigateur, Android, MCP, tout le bazar, et les scores sur leur benchmark dépassent GPT-5.4 et Claude Opus 4.8. Bon, c'est leur propre benchmark, donc à confirmer sur des évals indépendantes avant de crier victoire.

RecherchePaper
1 source
Prime Intellect publie prime-rl 0.6.0 pour entraîner des modèles MoE à mille milliards de paramètres sur des tâches RL à base d'agents
161MarkTechPost 

Prime Intellect publie prime-rl 0.6.0 pour entraîner des modèles MoE à mille milliards de paramètres sur des tâches RL à base d'agents

Prime Intellect a publié la version 0.6.0 de son framework open source prime-rl, conçu pour entraîner des modèles de langage de très grande taille via du reinforcement learning asynchrone. Cette mise à jour majeure cible spécifiquement les modèles Mixture-of-Experts (MoE) à l'échelle du trillion de paramètres, avec un focus sur des tâches dites "agentiques" longues et complexes, comme la résolution autonome de bugs logiciels. Pour illustrer les capacités du framework, l'équipe a entraîné GLM-5, le modèle de l'organisation zai-org, sur des tâches d'ingénierie logicielle (SWE) avec des séquences allant jusqu'à 131 000 tokens. Résultat : des temps d'étape inférieurs à cinq minutes, des batchs de 256 rollouts, le tout sur seulement 28 noeuds H200, une efficacité matérielle remarquable pour cette classe de modèles. Le framework est également compatible avec d'autres modèles MoE massifs comme Kimi-K2.7-Code de Moonshot AI ou le Nemotron-3-Ultra-550B de NVIDIA. Ce type d'infrastructure répond à un problème concret du reinforcement learning à grande échelle : les tâches agentiques génèrent des "outliers" temporels, certains rollouts de code pouvant s'étirer sur plusieurs heures. Dans un système synchrone classique, les GPU restent à l'arrêt en attendant la fin de ces longues exécutions avant chaque mise à jour de politique. prime-rl résout ce goulot d'étranglement en découplant complètement le moteur d'inférence du moteur d'entraînement : les deux fonctionnent et scalent indépendamment, avec un unique point de synchronisation au moment de la mise à jour des poids. Côté inférence, le système combine calcul en FP8 avec les kernels DeepEP et DeepGEMM, un "Wide Expert Parallelism" répartissant les experts sur 32 GPU ou plus, une séparation des workers de prefill et de decode, et un système de gestion hiérarchique du cache KV avec offloading vers CPU ou disque. Le mécanisme "Router Replay" (R3) est particulièrement notable : il rejoue les décisions de routage de l'inférence directement sur le trainer, réduisant le décalage KL d'un ordre de grandeur. Cette publication s'inscrit dans une course à la scalabilité du post-training par RL, accélérée par le succès des modèles de raisonnement comme DeepSeek-R1 ou les modèles de la série o1 d'OpenAI. L'approche MoE est devenue centrale pour atteindre des capacités de niveau "trillion de paramètres" sans exploser les coûts de calcul à l'inférence, mais elle impose des contraintes d'orchestration redoutables, notamment la coordination des experts entre des dizaines de GPU. Prime Intellect, qui se positionne sur l'entraînement distribué open source, mise sur prime-rl pour démocratiser l'accès à ces techniques jusqu'ici réservées aux grands laboratoires disposant de clusters propriétaires. La compatibilité avec Slurm et des routeurs comme NVIDIA Dynamo suggère une orientation claire vers des déploiements en production à l'échelle industrielle.

UELes laboratoires et startups européens travaillant sur le post-training par RL peuvent bénéficier de cet outil open source pour entraîner des modèles MoE à très grande échelle sans dépendre de clusters propriétaires.

💬 Le vrai problème du RL agentique, c'est pas la puissance brute, c'est les rollouts qui s'étirent sur des heures et laissent les GPU à l'arrêt. prime-rl règle ça en découplant complètement inférence et entraînement, avec un seul point de synchro, et leur mécanisme R3 réduit le décalage KL d'un ordre de grandeur. Un labo européen sans cluster propriétaire a désormais un chemin crédible vers le post-training RL à l'échelle trillion.

InfrastructureOpinion
1 source
Le plus rapide, le plus grand, le plus puissant : NVIDIA Blackwell domine le MLPerf Training 6.0
162NVIDIA AI Blog 

Le plus rapide, le plus grand, le plus puissant : NVIDIA Blackwell domine le MLPerf Training 6.0

NVIDIA a dominé l'édition MLPerf Training 6.0, le benchmark industriel de référence pour évaluer les performances d'entraînement des modèles d'IA, en remportant chaque catégorie du classement. La plateforme Blackwell de l'entreprise a affiché les temps d'entraînement les plus rapides sur la totalité des sept benchmarks du test, dont deux nouvelles charges de travail ajoutées à cette édition : DeepSeek-V3 671B et GPT-OSS-20B, deux modèles de type mixture-of-experts (MoE). NVIDIA est également le seul acteur à avoir soumis des résultats sur l'ensemble des sept benchmarks. À grande échelle, la société a déployé un cluster de 8 192 GPU GB200 NVL72 pour entraîner le modèle DeepSeek-V3, la plus vaste soumission Blackwell jamais réalisée dans MLPerf. Les partenaires cloud ont également brillé : CoreWeave a atteint la cible de qualité pour DeepSeek-V3 671B en seulement 2,02 minutes à 8 192 GPU avec des systèmes GB300 NVL72, tandis que Microsoft Azure a entraîné Llama 3.1 405B à la même échelle en 7,07 minutes, établissant un record sur ce benchmark. Ces résultats ont une portée directe sur la compétitivité des équipes qui construisent des modèles frontier. Raccourcir un cycle d'entraînement de plusieurs heures permet d'itérer plus vite, de réduire les coûts d'infrastructure et de lancer des produits commerciaux plus tôt. Le système GB300 NVL72 s'est montré jusqu'à 1,6 fois plus rapide que son prédécesseur GB200 NVL72 à scale identique, grâce à une densité de calcul accrue via le format numérique NVFP4, une capacité mémoire élargie et une enveloppe de puissance plus haute permettant au GPU de maintenir ses performances en continu. La technologie NVLink de cinquième génération, qui connecte les 72 GPU d'un même rack en un unique pool unifié de calcul et de mémoire, s'avère déterminante pour les architectures MoE, où les tokens doivent être acheminés dynamiquement vers différents sous-réseaux experts répartis sur de nombreux GPU. MLPerf est un programme de benchmarks indépendant, soumis à une révision par les pairs, qui sert de référence commune à l'ensemble de l'industrie pour comparer les performances d'entraînement de manière reproductible. NVIDIA y participe depuis ses débuts pour valider publiquement ses avancées matérielles. Avec Blackwell, l'entreprise consolide son leadership dans un moment clé : les modèles MoE, popularisés notamment par DeepSeek et Mistral, s'imposent comme l'architecture dominante pour les grands modèles de langage, car ils permettent de réduire le coût d'inférence tout en maintenant un haut niveau de performance. La prochaine génération de systèmes Blackwell Ultra et les progrès sur l'entraînement en précision réduite (NVFP4) indiquent que NVIDIA entend rester l'infrastructure de référence pour quiconque cherche à entraîner des modèles à la frontière des capacités actuelles.

UELes équipes européennes entraînant des modèles frontier en cloud bénéficieront indirectement de ces gains de performance matérielle, mais aucune entreprise ou institution française ou européenne n'est directement impliquée dans ces résultats.

InfrastructureActu
1 source
Sakana AI commercialise AB-MCTS avec Sakana Marlin, un agent capable de créer des rapports de 100 pages avec diapositives
163MarkTechPost 

Sakana AI commercialise AB-MCTS avec Sakana Marlin, un agent capable de créer des rapports de 100 pages avec diapositives

Sakana AI, la startup tokyoïte fondée par d'anciens chercheurs de Google DeepMind, a lancé cette semaine son premier produit commercial : Sakana Marlin, un agent de recherche autonome destiné aux entreprises. Contrairement à un chatbot classique qui répond en quelques secondes, Marlin fonctionne sur des sessions pouvant durer jusqu'à huit heures. L'utilisateur soumet un sujet ou une question stratégique, et l'agent planifie des hypothèses, explore des sources, vérifie ses conclusions de manière autonome, puis produit un rapport structuré de 60 à 100 pages accompagné d'un jeu de diapositives généré par IA. Chaque session mobilise des centaines, voire des milliers d'appels à des modèles de langage. La beta fermée d'avril 2026 a permis à environ 300 professionnels de tester l'outil sur des tâches réelles : formulation de stratégie, étude de marché, analyse de risques et veille concurrentielle. Sakana a également noué des partenariats avec MUFG et reçu un investissement stratégique de Citigroup. L'impact potentiel est significatif pour les équipes stratégiques et les directions générales. Marlin se positionne comme un "Virtual CSO" (Chief Strategy Officer) virtuel, capable de compresser en quelques heures un travail d'analyse qui nécessiterait normalement plusieurs semaines à une équipe entière. Les rapports produits incluent un corps principal, des références bibliographiques et des annexes, avec 60 à 80 sources citées par session. Pour les grandes entreprises confrontées à des décisions complexes dans des délais serrés, ce type d'outil pourrait transformer la façon dont la veille stratégique est produite et consommée, en déplaçant une partie du travail analytique des consultants ou analystes internes vers des agents automatisés. La technologie sous-jacente repose sur AB-MCTS, un algorithme de recherche arborescente adaptatif développé par Sakana à partir de travaux de recherche publiés dans une étude intitulée "Wider or Deeper? Scaling LLM Inference-Time Compute with Adaptive Branching Tree Search". À chaque étape du raisonnement, l'algorithme choisit entre deux stratégies : élargir l'exploration en générant un nouveau candidat, ou approfondir une piste prometteuse déjà identifiée. Une variante multi-modèles peut en outre router certaines étapes vers différents LLMs selon leur pertinence, une approche qui, dans les expériences d'ARC-AGI-2 menées par Sakana, a permis de résoudre 27,5 % des tâches en combinant o4-mini, Gemini 2.5 Pro et DeepSeek-R1, contre 23 % pour o4-mini seul. Marlin s'appuie également sur les travaux du projet AI Scientist de Sakana, publié dans la revue Nature, qui avait démontré la capacité d'un agent à conduire une découverte scientifique autonome de bout en bout.

UELes équipes stratégiques des grandes entreprises françaises et européennes pourraient adopter ce type d'agent pour automatiser la veille concurrentielle et les analyses de marché, réduisant potentiellement la demande en analystes et consultants internes.

OutilsOutil
1 source
Des chercheurs affirment avoir entraîné un modèle fondamental de zéro pour environ 1 500 dollars
164VentureBeat AI 

Des chercheurs affirment avoir entraîné un modèle fondamental de zéro pour environ 1 500 dollars

Des chercheurs de la startup Sapient Intelligence affirment avoir entraîné un grand modèle de langage de zéro pour environ 1 500 dollars. Le modèle, baptisé HRM-Text, compte un milliard de paramètres et repose sur une architecture radicalement différente des Transformers classiques : le Hierarchical Recurrent Model (HRM), introduit par Sapient en 2025. Contrairement aux LLM traditionnels qui s'entraînent sur des prédictions de tokens bruts à partir de milliards de pages web, HRM-Text se forme exclusivement sur des paires instruction-réponse, mimant directement les cas d'usage réels en entreprise. Malgré cette empreinte réduite en données et en calcul, le modèle atteint des performances comparables à des modèles open source bien plus volumineux sur les benchmarks sectoriels de référence, selon les résultats publiés par l'équipe de recherche. Ce résultat bouleverse une hypothèse fondamentale de l'industrie : que l'entraînement d'un modèle fondationnel est réservé aux géants disposant de centaines de millions de dollars. Pour les secteurs comme la finance, l'assurance ou la banque, cela ouvre une voie concrète vers des modèles propriétaires entraînés sur des données internes, sans dépendre d'un fournisseur externe comme OpenAI ou Google. Guan Wang, PDG de Sapient Intelligence, résume l'enjeu : une banque ou un fonds spéculatif peut avoir besoin d'un modèle qui comprend ses règles de conformité, ses modèles de risque et ses mémos d'analystes, sans jamais exposer ces données à l'extérieur. HRM-Text rend ce scénario économiquement viable, là où le fine-tuning de modèles denses existants reste lourd, coûteux et difficile à contrôler. L'architecture HRM découple le traitement en deux couches distinctes : une couche stratégique à évolution lente, chargée du raisonnement de haut niveau, et une couche d'exécution rapide pour les décisions immédiates. Cette séparation permet au modèle de concentrer sa puissance de calcul sur la compréhension de la tâche plutôt que sur la mémorisation de données internet sans rapport. Wang pointe les limites du paradigme dominant : "L'addiction à l'échelle dit : quand le modèle échoue, agrandis-le, ajoute des données, ajoute des GPU. Cela a fonctionné, mais on atteint un point de rendements décroissants." L'approche de Sapient s'inscrit dans un courant émergent qui remet en cause la toute-puissance du scaling, aux côtés d'autres travaux comme ceux de DeepSeek sur l'efficience architecturale. Si les performances annoncées se confirment à plus grande échelle et dans des cas d'usage réels, le modèle économique de l'IA d'entreprise pourrait être profondément reconfiguré.

UELes banques et assureurs européens pourraient entraîner des modèles propriétaires sur leurs données internes pour moins de 2 000 dollars, réduisant leur dépendance aux fournisseurs externes et facilitant la conformité aux exigences de l'AI Act en matière de contrôle des données sensibles.

LLMsPaper
1 source
MPCoT : raisonnement latent multi-chemin guidé par la récompense pour VLA avec mise à l'échelle à l'inférence
165arXiv cs.RO 

MPCoT : raisonnement latent multi-chemin guidé par la récompense pour VLA avec mise à l'échelle à l'inférence

MPCoT (Multi-Path Chain-of-Thought), un preprint arXiv publié le 5 juin 2026 (identifiant 2606.06245), propose un cadre de raisonnement latent multi-trajectoires guidé par récompense pour les politiques Vision-Language-Action (VLA). Le système initialise M hypothèses parallèles, les raffine sur K étapes à poids partagés, puis les agrège par pondération de confiance avant le décodage final de l'action. Un objectif d'entraînement spécifique, la "path-preference objective", évalue chaque branche candidate selon trois critères : cohérence avec des actions expertes, progression estimée par un modèle de monde ou un VLM, et feedback de succès d'exécution. Le système préserve l'interface d'action originale en 8 étapes et ne génère aucun token de raisonnement, éliminant la latence associée aux chaînes de réflexion textuelles classiques. Sur les benchmarks LIBERO et CALVIN, MPCoT améliore les performances sur les tâches à horizon long, avec des ablations confirmant les effets distincts de la profondeur K et de la largeur M. Le résultat central est que le "test-time scaling", qui a produit des gains majeurs dans les LLM via des modèles comme o1 d'OpenAI ou DeepSeek-R1, peut être transposé aux politiques robotiques sans surcoût de latence mesurable. Les approches chain-of-thought textuelles créent une interface indirecte entre raisonnement et commande motrice, problématique pour le contrôle en temps réel. MPCoT opère entièrement dans l'espace latent, rendant la délibération supplémentaire invisible pour l'interface d'exécution. Pour un intégrateur ou un décideur industriel, cela ouvre la possibilité d'améliorer les capacités d'un VLA existant en ajustant simplement K et M à l'inférence, sans réentraînement du modèle. Les politiques VLA constituent actuellement le terrain de concurrence central entre Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, et Stanford avec OpenVLA. Tous font face au même défi : la fragilité sur les tâches longues et les situations à forte incertitude, qui représente le principal écart entre démonstration et déploiement réel. MPCoT attaque directement ce "long-horizon gap" via une approche algorithmique, sans modifier l'architecture sous-jacente du modèle. La publication n'est pas adossée à un acteur industriel identifié et n'annonce aucun déploiement concret ; la validation sur hardware réel reste à faire, les benchmarks LIBERO et CALVIN utilisés dans cette étude étant entièrement simulés.

RechercheOpinion
1 source
Dépasser l'IA informelle, par Carina Hong (Axiom Math)
166Latent Space 

Dépasser l'IA informelle, par Carina Hong (Axiom Math)

En 2025, Axiom, une startup fondée seulement sept mois plus tôt, a réussi à résoudre les 12 problèmes du Putnam, l'un des concours mathématiques universitaires les plus difficiles au monde, avec un score de 12/12 (8/12 dans le temps imparti). À titre de comparaison, les meilleurs étudiants humains plafonnent autour de 110/120, DeepSeek avait atteint 103/120, et la médiane des participants se situe habituellement à 0 ou 1 point. Carina Hong, PDG d'Axiom, défend une approche radicalement différente de la majorité des laboratoires d'IA : la vérification formelle des preuves mathématiques via le langage Lean, un système qui permet de valider mécaniquement qu'un raisonnement est correct, de la même façon qu'un compilateur vérifie du code. La startup a par ailleurs publié en open source AXLE, une suite d'outils interactifs basés sur Lean pour explorer et manipuler des preuves. Sur le benchmark ProofGen Verina, qui mesure la capacité à générer du code accompagné de sa preuve de correction, Axiom revendique un score de 99 % (187 sur 189). L'enjeu dépasse largement les olympiades mathématiques. En mi-2026, Claude Code d'Anthropic et Codex d'OpenAI dominent le marché du développement logiciel assisté par IA, confirmant le pari d'Anthropic sur le code. Mais Hong estime que la maîtrise du code, aussi impressionnante soit-elle, ne suffit pas à atteindre l'AGI : des lacunes subsistent dans les capacités de raisonnement rigoureux. La vérification formelle offre quelque chose qu'aucune autre approche ne fournit encore : un signal de récompense binaire et fiable pour l'entraînement par renforcement. Plutôt que de s'appuyer sur des heuristiques statistiques comme RLHF ou GRPO, un système peut simplement vérifier si une preuve est valide, exactement comme on compile et teste du code. C'est un avantage considérable pour la qualité et la fiabilité des modèles. Hong illustre sa philosophie par l'exemple de Srinivasa Ramanujan, le mathématicien autodidacte indien dont l'intuition était prodigieuse, mais qui ne formulait pas ses résultats en preuves rigoureuses. Lorsque G.H. Hardy l'a convaincu de formaliser ses démonstrations, Ramanujan a lui-même progressé, car la rigueur l'a forcé à articuler des détails qui ouvrent de nouvelles voies. Surtout, ses preuves sont devenues transmissibles et cumulables : d'autres pouvaient s'appuyer dessus pour aller plus loin. C'est précisément ce que Hong appelle "composer l'intelligence" plutôt que de l'accumuler. Dans un secteur où les grands modèles rivalisent sur des benchmarks de coding et de raisonnement général, Axiom parie que la prochaine frontière se jouera sur la capacité à produire des raisonnements vérifiables de bout en bout, une approche qui pourrait s'avérer décisive à mesure que l'IA s'attaque à des domaines exigeant une fiabilité absolue.

RecherchePaper
1 source
Le code : outil de raisonnement et d'action des agents IA, pas seulement leur production
167The Decoder 

Le code : outil de raisonnement et d'action des agents IA, pas seulement leur production

Un article de synthèse publié récemment soutient que le véritable goulot d'étranglement dans le développement d'agents IA autonomes n'est pas le modèle de langage lui-même, mais la couche logicielle qui l'entoure. Baptisée "harness", cette infrastructure regroupe les outils externes, la mémoire persistante, les systèmes de test et les mécanismes de contrôle des permissions. C'est elle, selon les auteurs, qui transforme un modèle stateless en agent opérationnel. Le laboratoire chinois Deepseek a déjà tiré les conclusions pratiques de cette thèse en montant à Pékin une équipe dédiée exclusivement au développement du harness, avec une formule qui résume tout : modèle plus harness égal agent IA. Cela repose la question fondamentale de la valeur dans l'écosystème IA. Si le modèle seul ne suffit pas, les entreprises qui maîtrisent l'orchestration logicielle autour du modèle, et non uniquement l'entraînement, détiennent un avantage concurrentiel décisif. Pour les développeurs et les équipes produit, cela signifie que construire des agents performants exige autant d'ingénierie système que de puissance brute en paramètres. Cette vision s'inscrit dans une tendance plus large où les grands laboratoires et startups investissent massivement dans les frameworks agentiques. LangChain, LlamaIndex, ou encore les outils natifs d'Anthropic et OpenAI illustrent cette course à l'infrastructure plutôt qu'au modèle. Le mouvement de Deepseek, qui structure une équipe entière autour du harness plutôt que de simplement scaler les paramètres, pourrait annoncer une réorganisation profonde des priorités dans la course à l'IA agentique.

InfrastructureOpinion
1 source
mKernel : une bibliothèque de noyaux fusionnés multi-GPU et multi-nœuds pour les communications pilotées par GPU
168MarkTechPost 

mKernel : une bibliothèque de noyaux fusionnés multi-GPU et multi-nœuds pour les communications pilotées par GPU

Des chercheurs de l'Université de Californie à Berkeley, dans le cadre du projet UCCL, ont publié mKernel, une bibliothèque de noyaux CUDA persistants conçue pour fusionner les communications inter-GPU et le calcul en un seul et même noyau. Le problème qu'ils adressent est chiffré avec précision : dans les charges de travail d'IA en production, les communications peuvent absorber jusqu'à 43,6 % du temps de passe avant (forward pass) et 32 % du temps d'entraînement de bout en bout. Sur les modèles Mixture-of-Experts (MoE), cette proportion grimpe à 47 % du temps d'exécution total. mKernel propose cinq noyaux fusionnés couvrant les opérations les plus courantes : AllGather + GEMM, GEMM + AllReduce, dispatch MoE + GEMM, Ring Attention et GEMM + ReduceScatter. Chaque noyau fusionne simultanément les communications NVLink intra-nœud, le RDMA inter-nœud et le calcul dense, le tout orchestré directement par le GPU sans passer par le processeur central. Le gain fondamental de cette approche réside dans l'élimination du goulet d'étranglement lié au pilotage par le CPU. Dans le modèle classique, le processeur central contrôle les flux d'exécution et appelle des bibliothèques comme NCCL ou NVSHMEM pour déclencher les opérations collectives. Or, à l'échelle des infrastructures modernes, un rack GB300 NVL72 intègre 72 GPU Blackwell Ultra, livrant 720 PFLOPS en FP8 et 130 To/s de bande passante NVLink, les latences microsecondes introduites par chaque appel CPU créent des bulles visibles dans le pipeline. mKernel supprime ce niveau d'indirection : le GPU lui-même initie les transferts RDMA via libibverbs, sans dépendance à NCCL ou NVSHMEM. À l'intérieur du noyau, les blocs de threads (CTAs) se spécialisent automatiquement en rôles distincts, calcul, communication intra-nœud, envoi et réduction inter-nœud, avec un nombre de SMs alloués à chaque rôle ajustable selon la forme des tenseurs. Ce travail s'inscrit dans une tendance de fond qui voit la communauté de recherche en systèmes distribués chercher à repousser les limites du parallélisme à très grande échelle. Les architectures MoE, popularisées notamment par les modèles de DeepSeek et Mixtral, amplifient les besoins de communication car chaque token doit être routé dynamiquement vers des experts potentiellement situés sur des nœuds différents. Les bibliothèques existantes comme Flux ou DeepEP avaient déjà exploré la fusion de noyaux, mais restaient généralement confinées à un seul nœud ou un seul GPU. mKernel, évalué sur deux clusters de 2 nœuds à 8 GPU H200 chacun, étend ce paradigme au cas multi-nœud, ouvrant la voie à des entraînements et inférences distribués où la communication cesse d'être un frein structurel à la scalabilité.

UELes laboratoires et entreprises européens entraînant des modèles distribués à grande échelle (notamment MoE) pourraient bénéficier indirectement de cette bibliothèque open-source pour réduire leur overhead de communication inter-GPU.

RecherchePaper
1 source
Nouvelles licornes à 10 milliards dans l'infra IA : Fireworks, Baseten (et OpenRouter en chemin)
169Latent Space 

Nouvelles licornes à 10 milliards dans l'infra IA : Fireworks, Baseten (et OpenRouter en chemin)

Trois acteurs de l'infrastructure d'inférence IA ont fait parler d'eux cette semaine avec des levées de fonds aux valorisations vertigineuses. Fireworks AI serait en discussions pour une levée qui valoriserait la startup à 15 milliards de dollars, soit 3,75 fois sa valorisation précédente en seulement sept mois. Baseten, de son côté, serait en train de finaliser un tour qui l'amènerait à 11 milliards de dollars, multipliant par 2,2 sa valeur en trois mois à peine. Plus discret mais tout aussi significatif, OpenRouter a bouclé une Série C de 113 millions de dollars, après avoir multiplié ses volumes par cinq en six mois. Ces trois sociétés ont en commun de se positionner sur la même couche critique : permettre aux entreprises d'appeler, de router et d'orchestrer des modèles de langage à grande échelle, sans se lier à un seul fournisseur. Ces valorisations illustrent un basculement structurel dans la manière dont l'industrie évalue la valeur dans l'IA. La compétition ne se joue plus uniquement autour du modèle de base, mais autour de ce que les ingénieurs appellent le "harness" : l'ensemble formé par le modèle, l'environnement d'exécution, la boucle d'évaluation et les mécanismes de correction. DeepSeek constituerait explicitement une équipe dédiée à cette couche, Google a formalisé son infrastructure d'agents Gemini comme une API unique intégrant sandbox, persistance et gestion du contexte, et LangChain a mis à jour ses outils dans la même direction. Le benchmark DeepSWE, salué par des praticiens comme le premier à vraiment refléter l'expérience quotidienne des développeurs, a montré que les modèles se distinguent davantage sur ces tâches réelles que sur les classements publics traditionnels. Qwen3.7 Max d'Alibaba s'est par exemple classé quatrième sur Code Arena Frontend, au niveau de Claude Opus 4.6 sur les tâches de développement web agentique. Ce mouvement s'inscrit dans une tendance plus large qui s'accélère depuis le début de l'année, baptisée "Inference Inflection" par les observateurs du secteur. Après des années où les investissements se concentraient sur l'entraînement des modèles, l'argent afflue désormais vers les couches d'inférence et d'orchestration, jugées indispensables à toute mise en production sérieuse. En parallèle, la recherche explore de nouvelles pistes pour répondre aux limites de mémoire des modèles : le papier "Language Models Need Sleep", remarqué cette semaine, propose un mécanisme de consolidation inspiré du sommeil humain, qui convertit le contexte récent en poids permanents avant de vider le cache, préservant la latence à l'exécution tout en étendant la mémoire long terme. Les prochains mois diront si ces valorisations tiennent, mais la direction est claire : l'infrastructure d'inférence est devenue le terrain où se joue la prochaine phase de l'IA.

UELa concentration des investissements dans la couche d'inférence IA autour d'acteurs américains renforce la dépendance potentielle des entreprises et startups européennes vis-à-vis de fournisseurs extra-européens pour leurs déploiements en production.

💬 x3,75 en sept mois pour Fireworks, c'est pas une levée, c'est un signal. Le modèle devient une commodité, et l'argent coule maintenant vers la couche qui permet d'en changer à volonté sans se retrouver piégé avec un seul fournisseur. Bon, reste à voir si ça tient quand AWS ou Google décident de proposer ça en bundle.

BusinessOpinion
1 source
Échantillonnage guidé à l'inférence par un vérificateur de progression des tâches pour la manipulation robotique
170arXiv cs.RO 

Échantillonnage guidé à l'inférence par un vérificateur de progression des tâches pour la manipulation robotique

Une équipe de recherche publie TapSampling (arXiv:2605.25547, mai 2026), un cadre plug-and-play d'échantillonnage au moment de l'inférence pour la manipulation robotique. Là où la majorité des travaux du domaine cherchent à améliorer les performances en augmentant la taille des données d'entraînement ou des modèles, TapSampling explore un axe différent : l'exploitation du calcul disponible à l'inférence. Le système repose sur deux composants. D'abord, un Action-VAE qui projette les actions générées par la politique dans un espace latent de faible dimension via une distribution postérieure compressée, permettant de tirer un nombre arbitraire d'actions candidates approximant la distribution réelle. Ensuite, un vérificateur sémantique qui reformule la sélection d'actions comme une prédiction de progression de tâche (task-progress outcome prediction), en exploitant la structure séquentielle intrinsèque des jeux de données robotiques pour choisir l'action la plus prometteuse de façon interprétable. L'intérêt principal réside dans l'agnosticisme vis-à-vis de la politique sous-jacente : TapSampling s'applique sans fine-tuning additionnel à des modèles généralistes existants, qu'ils soient basés sur la diffusion ou sur des architectures autorégressives. Les expériences présentées en simulation et en conditions réelles montrent des améliorations qualifiées de « substantielles » sur plusieurs politiques généralistes, bien que l'abstract ne fournisse pas de chiffres précis de taux de réussite, ce qui invite à la prudence avant de juger de l'ampleur réelle des gains. Pour les ingénieurs robotique et les intégrateurs, l'approche ouvre la possibilité d'améliorer des politiques déjà déployées sans réentraînement, en ajoutant simplement un surcoût computationnel à l'inférence. Ce travail s'inscrit dans une tendance plus large consistant à transposer le test-time compute scaling, popularisé par les grands modèles de langage (OpenAI o1, DeepSeek-R1), vers la robotique embodied. D'autres approches comparables incluent le Best-of-N sampling avec des modèles de récompense appris séparément, ainsi que les méthodes de vérification intégrées dans des politiques comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). TapSampling se distingue par un vérificateur ancré dans la progression de tâche plutôt que dans une récompense exogène, ce qui lui confère une meilleure lisibilité sémantique. Le code et les modèles sont mis à disposition via la page projet des auteurs, ce qui permettra une reproduction et une évaluation indépendante des résultats annoncés.

RobotiqueActu
1 source
L'écart se creuse-t-il entre Anthropic et les modèles open source ?
171The Information AI 

L'écart se creuse-t-il entre Anthropic et les modèles open source ?

La montée en flèche des coûts des modèles d'IA frontier pousse plusieurs développeurs à envisager un repli vers l'open source. Des entreprises aussi sophistiquées qu'Uber ont brûlé l'intégralité de leur budget annuel en IA en quelques mois seulement, un dérapage qui illustre la pression financière que font peser des fournisseurs comme Anthropic et OpenAI. En réponse, Uber et Airbnb auraient déjà commencé à déléguer les tâches les plus simples à des modèles open source moins coûteux, tout en conservant les modèles frontier pour les cas d'usage complexes. Un dirigeant d'une grande entreprise cliente d'OpenAI et d'Anthropic a confié avoir testé Kimi K2.6 de Moonshot AI ainsi que DeepSeek V4, deux modèles open source récents qui affichent des résultats solides sur les benchmarks standards. Le verdict reste mitigé. Si ces modèles s'en sortent correctement sur des questions de surface et des exercices de référence, ils peinent dès que l'interrogation devient plus exigeante. L'exemple donné est parlant : un modèle peut résoudre un casse-tête logique classique, mais échoue dès qu'on modifie légèrement les hypothèses de départ. Cette fragilité dans le raisonnement en profondeur constitue un obstacle réel pour les entreprises dont les cas d'usage requièrent une analyse rigoureuse, des relances pertinentes ou une cohérence sur des chaînes de questions complexes. Le fossé qualitatif entre l'open source et les modèles frontier semble donc persistant, malgré les progrès rapides observés ces derniers mois. L'essor de l'open source n'en reste pas moins une tendance structurelle. Les données du fournisseur d'inférence OpenRouter indiquent une croissance globale de l'utilisation de ces modèles, signe que le marché se segmente progressivement. Les grandes entreprises adoptent une stratégie hybride : modèles bon marché pour le volume, modèles puissants pour la valeur ajoutée. La question centrale devient alors de savoir si des acteurs comme DeepSeek ou Moonshot AI pourront combler l'écart de raisonnement qui les sépare encore d'Anthropic et d'OpenAI, et à quelle vitesse.

UELes entreprises européennes clientes d'Anthropic ou OpenAI font face aux mêmes pressions budgétaires et pourraient adopter la même stratégie hybride open source / frontier pour maîtriser leurs coûts IA.

LLMsOpinion
1 source
UniJEPA : amélioration des politiques robotiques via l'apprentissage unifié de représentations continues et discrètes
172arXiv cs.RO 

UniJEPA : amélioration des politiques robotiques via l'apprentissage unifié de représentations continues et discrètes

Une équipe de chercheurs propose UniJEPA (arXiv:2510.10642, troisième révision), un framework de politique robotique généraliste pré-entraîné sur plus d'un million de vidéos de manipulation instruite issues d'internet, puis affiné sur des données collectées directement sur le robot cible. L'architecture repose sur une approche JEPA (Joint Embedding Predictive Architecture) étendue pour modéliser des représentations visuelles continues de haute dimension. Les résultats expérimentaux annoncent un gain de 9 % en environnements de simulation et de 12 % sur des tâches réelles hors-distribution par rapport aux méthodes de référence actuelles. Il s'agit d'un preprint de recherche, pas d'un déploiement industriel. L'enjeu central est un angle mort persistant dans les politiques VLA (Vision-Language-Action) : elles s'appuient soit sur des VLM (modèles de langage visuels, forts en compréhension sémantique) soit sur des modèles génératifs (forts en modélisation de dynamiques visuelles), rarement les deux simultanément. Pour un intégrateur ou un COO industriel, cela se traduit par des politiques qui peinent à s'adapter à un nouvel atelier, un nouvel éclairage ou de nouvelles pièces sans re-collecte de données coûteuse. Le gain de 12 % sur les tâches hors-distribution est précisément la métrique critique ici : elle mesure la capacité de généralisation sans données supplémentaires, le graal opérationnel pour tout déploiement multi-site. UniJEPA répond en apprenant des représentations prédictives continues des futurs états visuels, converties ensuite en tokens d'action, validant l'applicabilité des architectures JEPA, originellement développées par Yann LeCun et son équipe chez Meta AI (I-JEPA, V-JEPA), au domaine de la politique robotique. Ce travail s'inscrit dans un paysage VLA très actif : Pi-0 de Physical Intelligence (combinant diffusion et VLM), OpenVLA, Octo et les modèles RT-X de Google DeepMind constituent les concurrents directs les plus cités. UniJEPA se distingue par son ancrage dans les architectures unifiées compréhension-génération, un territoire également exploré par des modèles comme Janus de DeepSeek. Publié en version 3 sur arXiv, le papier n'a pas encore passé la révision par les pairs d'une conférence de référence (ICRA, CoRL, RSS), ce qui invite à une lecture prudente des chiffres annoncés, dont le contexte exact des benchmarks n'est pas détaillé dans le résumé. Les prochaines étapes naturelles seraient une validation sur des embodiments commerciaux et un benchmark élargi au-delà des simulateurs utilisés dans les expériences actuelles.

RechercheOpinion
1 source
9 meilleurs outils IA pour le développement piloté par les specs en 2026 : Kiro, BMAD, GSD et plus encore
173MarkTechPost 

9 meilleurs outils IA pour le développement piloté par les specs en 2026 : Kiro, BMAD, GSD et plus encore

En 2026, le développement piloté par les spécifications (SDD pour spec-driven development) s'impose comme une réponse structurelle à un problème croissant dans les équipes de développement augmentées par l'IA : générer du code rapidement ne sert à rien si ce code ne correspond pas aux besoins réels du système. Un classement des neuf outils les plus utilisés pour mettre en oeuvre cette approche met en lumière trois acteurs majeurs. AWS Kiro (kiro.dev) est un IDE agentique qui guide les développeurs en trois phases formalisées, Exigences, Design et Tâches, et produit trois artefacts structurés. Il utilise la notation EARS pour les user stories et un système de hooks événementiels qui déclenchent automatiquement des vérifications (tests, mises à jour de documentation, scans de sécurité) à chaque sauvegarde de fichier. Côté modèles, Kiro s'appuie sur un routeur automatique combinant Claude Sonnet, Qwen, DeepSeek, GLM et MiniMax. GitHub Spec Kit (93 000 étoiles, version 0.8.7 publiée le 7 mai 2026) est l'option open source la plus adoptée, compatible avec plus de 30 agents dont Claude Code, Copilot et Gemini CLI. BMAD-METHOD, lui, orchestre plus de 12 agents spécialisés couvrant l'ensemble du cycle de développement logiciel ; sa version 6.6.0, sortie le 29 avril 2026, totalise 46 700 étoiles et 5 500 forks sur GitHub. L'enjeu central de ces outils est de renverser la logique de travail habituelle : au lieu de coder d'abord et d'affiner ensuite, le développeur formalise son intention en amont, et le code devient une sortie générée à partir de cette spécification. Pour les équipes professionnelles, cela réduit significativement le risque de divergence entre ce qui est produit et ce qui était réellement attendu, un problème qui coûte cher en retours arrière et en dette technique. Kiro s'adresse aux équipes qui veulent un environnement familier (il est construit sur Code OSS), tandis que Spec Kit convient aux équipes souhaitant conserver leur IDE existant. BMAD-METHOD cible des projets plus complexes nécessitant une coordination entre rôles distincts (product management, architecture, QA, etc.). Ce mouvement vers le SDD reflète une maturité croissante dans l'usage de l'IA en développement logiciel. La première vague d'outils misait sur la vitesse brute de génération de code ; la deuxième, celle que ces neuf outils incarnent, mise sur la cohérence et la traçabilité. GitHub a résumé la philosophie de Spec Kit en une formule : le code est désormais la sortie de dernier kilomètre, l'intention est la source de vérité. BMAD introduit avec sa V6 une équipe d'agents multi-plateformes, permettant à la même configuration de fonctionner indifféremment sur Claude Code, Cursor ou Codex. La convergence de ces approches suggère que la prochaine bataille dans les outils de développement ne se jouera pas sur la qualité du code généré, mais sur la qualité des spécifications qui le précèdent.

💬 La première vague d'outils IA misait sur la vitesse brute, et on a tous couru après. Bon, résultat : du code généré en 10 minutes qu'on passe 3 heures à corriger parce que la spec était dans la tête du dev et nulle part ailleurs. Kiro et Spec Kit ne règlent pas tout, mais l'idée de formaliser l'intention avant le code, c'est le truc qu'on aurait dû faire dès le départ.

OutilsOutil
1 source
Zyphra lance ZAYA1-8B : un modèle de raisonnement MoE entraîné sur matériel AMD aux performances bien supérieures à sa taille
174MarkTechPost 

Zyphra lance ZAYA1-8B : un modèle de raisonnement MoE entraîné sur matériel AMD aux performances bien supérieures à sa taille

Zyphra AI a publié ZAYA1-8B, un petit modèle de langage de type Mixture of Experts (MoE) comptant 760 millions de paramètres actifs pour 8,4 milliards de paramètres au total. Entraîné intégralement sur des processeurs AMD, un cluster de 1 024 cartes AMD Instinct MI300x interconnectées via AMD Pensando Pollara, construit en partenariat avec IBM, le modèle est désormais disponible sous licence Apache 2.0 sur Hugging Face et en endpoint serverless sur Zyphra Cloud. Malgré sa taille modeste, ZAYA1-8B affiche des performances compétitives avec des modèles bien plus grands sur les benchmarks de mathématiques et de code : il surpasse Claude 4.5 Sonnet et GPT-5-High sur le HMMT'25, une compétition de mathématiques avancées (89,6 points contre 88,3), et se rapproche des meilleurs modèles open-weight comme DeepSeek-V3.2. Cette efficacité repose sur une méthode inédite de calcul à l'inférence baptisée Markovian RSA, ainsi que sur une architecture MoE++ combinant trois innovations techniques : une attention convolutive compressée réduisant le KV-cache d'un facteur 8, un routeur basé sur un réseau de neurones MLP avec équilibrage de charge par contrôleur PID, et un mécanisme de mise à l'échelle résiduelle apprise pour stabiliser l'entraînement en profondeur. La distinction entre paramètres actifs et paramètres totaux est au coeur de l'intérêt du modèle. Dans un modèle classique, tous les paramètres s'activent à chaque token traité ; dans un MoE, seule une fraction des experts est sollicitée à chaque inférence. Avec seulement 760 millions de paramètres actifs par passe, ZAYA1-8B peut tourner en local sur des appareils grand public, s'intégrer dans des pipelines à calcul augmenté et servir des requêtes avec une latence réduite, tout en maintenant des performances proches de modèles dix fois plus grands. Pour les développeurs et entreprises qui cherchent à déployer des capacités de raisonnement avancées sans infrastructure lourde, ce rapport coût-performance représente une avancée concrète. ZAYA1-8B s'inscrit dans une tendance de fond qui voit plusieurs laboratoires challenger, DeepSeek en tête depuis début 2025, démontrer que l'architecture et la méthode d'entraînement comptent autant que la taille brute des modèles. Zyphra, encore peu connu du grand public, affirme avoir bâti un pipeline d'entraînement en cinq étapes post-préentraînement, intégrant notamment un échauffement au raisonnement, du reinforcement learning en cascade, et des étapes spécifiques de calcul augmenté à l'inférence. L'entraînement entièrement réalisé sur AMD est également un signal politique : dans un secteur dominé par Nvidia, valider une chaîne de production complète sur hardware concurrent ouvre la voie à une diversification des infrastructures IA. Les prochains modèles de Zyphra, selon ses propres communications, viseront des tailles supérieures avec la même philosophie d'efficacité par paramètre.

LLMsOpinion
1 source
Hapag-Lloyd utilise Amazon Bedrock pour transformer les retours clients en informations exploitables
175AWS ML Blog 

Hapag-Lloyd utilise Amazon Bedrock pour transformer les retours clients en informations exploitables

Hapag-Lloyd, l'un des leaders mondiaux du transport maritime de conteneurs, a déployé une solution d'analyse automatisée des retours clients basée sur Amazon Bedrock, le service d'IA générative d'AWS. L'armateur allemand, qui exploite une flotte de 313 porte-conteneurs représentant 2,5 millions d'EVP de capacité de transport, emploie environ 14 000 personnes dans son segment de lignes régulières et gère plus de 400 bureaux dans 140 pays. Son équipe d'ingénierie produit, répartie entre Hambourg et Gdańsk, pilote cette initiative dans le cadre d'une ambition plus large de devenir une entreprise dite "AI-native". Le système s'appuie sur Amazon Bedrock, LangChain et LangGraph, ainsi qu'Elasticsearch pour collecter les commentaires clients, en extraire le sentiment, identifier des thèmes récurrents et produire des synthèses exploitables. L'enjeu est d'abord opérationnel : avant cette solution, les chefs de produit exportaient manuellement des fichiers CSV toutes les deux semaines, parcouraient des centaines de commentaires et les catégorisaient à la main, un travail qui pouvait mobiliser plusieurs heures, parfois plusieurs jours, avant chaque réunion de revue produit. Désormais, l'ensemble de ce flux est automatisé, de l'ingestion des données à la production d'insights. Les équipes peuvent ainsi se concentrer sur la stratégie et l'innovation plutôt que sur l'analyse répétitive. Pour une entreprise qui relie plus de 600 ports via 133 lignes régulières mondiales et traite un volume massif d'interactions clients, la capacité à lire rapidement les signaux du terrain constitue un avantage concurrentiel direct sur la qualité de service et la réactivité produit. Cette transformation s'inscrit dans une dynamique plus large de l'industrie du shipping, où la digitalisation s'accélère sous la pression de la concurrence et des attentes croissantes des chargeurs. Hapag-Lloyd a construit sa capacité sur une stack technologique qu'il maîtrise en propre, ce qui lui a permis d'itérer rapidement vers des usages d'IA générative sans dépendance contraignante. Le choix d'Amazon Bedrock est également révélateur : le service donne accès via une API unifiée aux modèles d'Anthropic, Meta, Mistral, DeepSeek et d'autres, avec des garanties de sécurité et de confidentialité adaptées aux exigences d'un groupe coté en bourse. À mesure que d'autres armateurs et acteurs logistiques adoptent des approches similaires, la capacité à transformer le feedback client en décisions produit en temps quasi réel pourrait devenir un standard du secteur plutôt qu'un avantage différenciant.

UEHapag-Lloyd, armateur allemand coté en bourse avec ses équipes à Hambourg et Gdańsk, automatise l'analyse de ses retours clients via Amazon Bedrock, signalant l'accélération de l'IA générative dans la logistique maritime européenne.

OutilsOutil
1 source
Guide pratique : affiner un LLM avec TRL, du supervised fine-tuning au raisonnement DPO et GRPO
176MarkTechPost 

Guide pratique : affiner un LLM avec TRL, du supervised fine-tuning au raisonnement DPO et GRPO

Un guide complet consacré à l'entraînement post-initialisation des grands modèles de langage vient d'être publié, proposant une progression pédagogique couvrant quatre techniques clés : le réglage fin supervisé (SFT), la modélisation de récompense (RM), l'optimisation directe des préférences (DPO) et l'optimisation de politique par groupe relatif (GRPO). Le tutoriel s'appuie sur la bibliothèque TRL (Transformer Reinforcement Learning), développée et maintenue par Hugging Face, combinée à des outils comme PEFT et LoRA, qui permettent de réduire drastiquement la mémoire nécessaire. Point notable : l'ensemble du pipeline peut tourner sur un GPU T4 de Google Colab, soit environ 15 Go de VRAM, rendant ces techniques accessibles à quiconque dispose d'un compte Google. Le modèle de base utilisé est Qwen2.5-0.5B-Instruct, un modèle léger de 500 millions de paramètres développé par Alibaba, qui sert de point de départ à chacune des quatre étapes d'alignement. Ce guide se distingue par sa complétude : peu de tutoriels enchaînent l'intégralité du pipeline d'alignement, du SFT jusqu'au raisonnement par GRPO, avec du code fonctionnel et des explications progressives. Pour les équipes techniques cherchant à adapter un modèle open-weight à des usages métiers spécifiques, ou à reproduire les techniques d'alignement des grands laboratoires, ce type de ressource pratique est précieux. Le GRPO notamment, popularisé par DeepSeek-R1 en janvier 2025, est désormais intégré nativement dans TRL, ce qui permet d'entraîner des modèles à raisonner par étapes vérifiables sans les coûts prohibitifs d'un pipeline RLHF classique avec modèle de récompense séparé. L'alignement des LLMs s'est imposé comme l'un des sujets centraux de l'IA depuis qu'InstructGPT d'OpenAI a montré qu'un volume relativement faible de données de préférence pouvait radicalement améliorer le comportement d'un modèle. TRL est devenu la référence open source pour implémenter ces méthodes, avec des mises à jour qui intègrent régulièrement les dernières avancées de la recherche. La tendance est aujourd'hui aux approches qui n'exigent pas de modèle de récompense distinct, comme DPO et GRPO, car elles simplifient le pipeline tout en atteignant des résultats comparables. Ce contexte explique l'intérêt croissant pour le fine-tuning de modèles open-weight comme Qwen, Llama ou Mistral, que des startups et des équipes internes cherchent à spécialiser sans dépendre d'API propriétaires.

UEHuggingFace, entreprise française éditrice de la bibliothèque TRL au cœur de ce guide, positionne l'écosystème open source européen comme référence pour l'alignement des LLMs face aux pipelines propriétaires américains.

LLMsTuto
1 source
Ant Group publie en open source le modèle Ling-2.6-Flash avec plusieurs options de précision
177Pandaily 

Ant Group publie en open source le modèle Ling-2.6-Flash avec plusieurs options de précision

Ant Group, la filiale fintech d'Alibaba, a officiellement mis en open source son modèle Ling-2.6-Flash le 29 avril 2026, via l'équipe BaiLing spécialisée en grands modèles de langage. Le modèle compte 104 milliards de paramètres au total, dont 7,4 milliards activés à l'inférence, et est proposé en plusieurs formats de précision, BF16, FP8 et INT4, pour s'adapter à différents environnements matériels et contraintes de déploiement. Fait notable : deux semaines avant cette annonce officielle, le modèle avait été discrètement mis en ligne sur la plateforme OpenRouter sous le nom anonyme "Elephant Alpha", permettant à Ant Group de collecter des retours développeurs et d'effectuer plusieurs cycles d'optimisation, notamment sur la commutation bilingue chinois-anglais et la compatibilité avec les principaux frameworks de développement. Les performances techniques de Ling-2.6-Flash le positionnent comme un concurrent sérieux dans le segment des modèles efficaces à grande échelle. Son architecture linéaire hybride lui permet d'atteindre 340 tokens par seconde sur une configuration 4x GPU H20, avec un débit de prefill 2,2 fois supérieur à celui du Nemotron-3-Super de NVIDIA. Sur les benchmarks Artificial Analysis, il n'a consommé que 15 millions de tokens pour accomplir ses tâches, soit environ un dixième de ce que nécessite Nemotron-3-Super, un ratio coût-performance particulièrement attractif pour les équipes cherchant à déployer des agents IA à l'échelle. Sur des benchmarks spécialisés comme BFCL-V4, TAU2-bench ou SWE-bench Verified, ses résultats rivalisent avec des modèles aux paramètres actifs bien plus importants. Cette publication s'inscrit dans une stratégie d'open source agressive que mènent plusieurs grandes entreprises technologiques chinoises face à la domination américaine dans le domaine des LLM. Ant Group rejoint ainsi DeepSeek, Alibaba (Qwen) et ByteDance (Doubao) dans une course à la transparence et à l'adoption communautaire. Le choix de tester le modèle anonymement avant de le revendiquer reflète une approche plus pragmatique du lancement : valider en conditions réelles avant de s'exposer publiquement. La focalisation sur les cas d'usage agents, planification multi-étapes, utilisation d'outils, exécution de tâches complexes, indique que les prochaines batailles de l'IA ne se joueront pas sur les chatbots grand public, mais sur l'automatisation des workflows professionnels.

LLMsOpinion
1 source
[AINews] Rien de notable aujourd'hui
178Latent Space 

[AINews] Rien de notable aujourd'hui

La journée du 27-28 avril 2026 n'a pas produit de séisme dans l'industrie de l'IA, mais plusieurs sorties de modèles méritent attention. NVIDIA a lancé Nemotron 3 Nano Omni, un modèle multimodal open-source de 30 milliards de paramètres actifs (3B actifs, architecture MoE) capable de traiter texte, images, vidéo, audio et documents, avec une fenêtre de contexte de 256 000 tokens orientée vers les usages agentiques. Sa distribution a été immédiate : OpenRouter, LM Studio, Ollama, Fireworks, Together et une dizaine d'autres plateformes ont annoncé sa disponibilité le jour même. Le modèle intègre un encodeur audio Parakeet, fonctionne pour l'instant uniquement en anglais, et affiche un taux d'erreur de 5,95 % sur le benchmark Open ASR, avec un débit annoncé neuf fois supérieur à des modèles omni comparables. Du côté de Poolside, la startup a publié son premier modèle public, Laguna XS.2, un modèle de code MoE de 33 milliards de paramètres totaux (3B actifs) entraîné intégralement en interne, distribué sous licence Apache 2.0, et conçu pour tourner sur un seul GPU. Microsoft, de son côté, a sorti TRELLIS.2, un modèle open-source de 4 milliards de paramètres pour la génération de scènes 3D texturées à partir d'images, avec une résolution allant jusqu'à 1536 cubes et une compression spatiale 16x. Ces sorties illustrent une tendance de fond : la compétition sur l'efficacité d'inférence s'intensifie, et les acteurs cherchent à démocratiser des capacités avancées sur du matériel accessible. Que Poolside publie un modèle de code haute performance tournant sur un seul GPU, ou que NVIDIA intègre audio et vidéo dans un modèle ouvert, le message est clair : les capacités multimodales et agentiques descendent rapidement vers des configurations matérielles grand public. Pour les développeurs et les entreprises, cela signifie des coûts d'infrastructure moindres pour déployer des agents capables de comprendre des documents complexes ou de générer des assets 3D. En parallèle, l'infrastructure d'inférence connaît sa propre effervescence. La version 0.20.0 de vLLM, framework open-source de référence pour servir les grands modèles, embarque un cache KV 2 bits (TurboQuant) offrant quatre fois plus de capacité, ainsi qu'une amélioration de latence de 2,1 % grâce à une fusion d'opérations. Les benchmarks publiés par SemiAnalysis sur les puces B300 de NVIDIA indiquent un débit jusqu'à huit fois supérieur à celui des H200 pour des charges DeepSeek V4 Pro. Dans ce contexte, des voix techniques soulignent que DeepSeek s'éloigne progressivement de la dépendance exclusive à CUDA via ses TileKernels, ouvrant la voie à des déploiements sur accélérateurs hétérogènes, y compris des puces non-NVIDIA. Les prochaines semaines devraient confirmer si GPT-6, dont le buzz commence à monter, reconfigurera à nouveau les priorités de l'écosystème.

UELes modèles open-source publiés ce jour (Nemotron 3 Nano Omni, Laguna XS.2, TRELLIS.2) sont immédiatement accessibles aux développeurs et entreprises européennes via Ollama, Hugging Face et autres plateformes, réduisant les coûts d'infrastructure pour déployer des agents multimodaux sur du matériel grand public.

LLMsActu
1 source
Raisonnement adaptatif : les LLM savent quand raisonner dans l'espace latent
179Apple Machine Learning 

Raisonnement adaptatif : les LLM savent quand raisonner dans l'espace latent

Des chercheurs ont publié des travaux sur une nouvelle approche d'optimisation du raisonnement dans les grands modèles de langage (LLM), baptisée "Adaptive Thinking". Le principe : permettre aux modèles d'ajuster dynamiquement leur budget de calcul selon la complexité réelle d'une requête, plutôt que d'appliquer un niveau fixe de raisonnement à chaque réponse. L'étude exploite la technique du chain-of-thought (CoT), qui consiste à générer une chaîne de raisonnement intermédiaire avant de produire une réponse, et introduit la notion de raisonnement dans l'espace latent, une représentation interne au modèle. L'enjeu est directement économique et qualitatif : allouer trop de capacité de calcul à des questions simples est un gaspillage ; en allouer trop peu à des questions complexes dégrade la performance. Les chercheurs utilisent la "self-consistency", c'est-à-dire le degré d'accord entre plusieurs chemins de raisonnement parallèles, comme indicateur proxy de la nécessité réelle de raisonner. Cette métrique permet au modèle de détecter automatiquement si une question mérite un effort cognitif étendu ou une réponse directe. Ce travail s'inscrit dans une tendance de fond qui agite les laboratoires depuis l'émergence des modèles de type "reasoning" comme o1 d'OpenAI ou DeepSeek-R1 : comment rendre le raisonnement à l'inférence à la fois plus puissant et plus efficient. Trouver le bon équilibre entre budget de calcul et performance est devenu un axe de compétition majeur, notamment pour les applications en temps réel où la latence et le coût par requête sont critiques.

RecherchePaper
1 source
La Chine clone-t-elle l’IA américaine ? La Maison-Blanche accuse son rival de pillage industriel
180Frandroid 

La Chine clone-t-elle l’IA américaine ? La Maison-Blanche accuse son rival de pillage industriel

La Maison-Blanche a publié un mémorandum interne révélant que des entreprises chinoises mènent des opérations de piratage industriel visant à reproduire les grands modèles d'intelligence artificielle américains, notamment ChatGPT d'OpenAI et Claude d'Anthropic. La technique incriminée est le "model distillation" : en interrogeant massivement un modèle existant, il est possible d'entraîner un modèle concurrent à bien moindre coût, sans accéder directement aux poids ou au code source de l'original. Cette pratique permettrait à des acteurs chinois de contourner des années de recherche et des milliards de dollars d'investissement. L'enjeu est considérable pour les entreprises américaines qui ont engagé des ressources colossales dans le développement de leurs modèles. Si le clonage à grande échelle est confirmé, c'est l'avantage compétitif fondamental de l'industrie IA américaine qui est menacé : non pas le code, mais l'intelligence accumulée dans les paramètres des modèles. Pour les utilisateurs et les investisseurs, cela soulève des questions sur la viabilité des barrières à l'entrée dans ce secteur et sur la capacité des entreprises à rentabiliser leurs recherches face à des concurrents qui s'approprient leurs résultats. Cette accusation s'inscrit dans un contexte de rivalité technologique intense entre Washington et Pékin. Le phénomène avait déjà éclaté au grand jour début 2025 avec DeepSeek, dont plusieurs chercheurs avaient soupçonné qu'il s'était appuyé sur des sorties de ChatGPT pour s'entraîner. Les États-Unis ont depuis renforcé les contrôles à l'exportation sur les puces Nvidia destinées à la Chine, mais ces restrictions ne bloquent pas les attaques par distillation, qui n'exigent qu'un accès aux API publiques.

UELa rivalité sino-américaine sur l'IA renforce les enjeux de souveraineté technologique en Europe, où les institutions et régulateurs pourraient être amenés à encadrer l'accès aux API des grands modèles pour limiter des risques similaires de distillation à grande échelle.

Xiaomi lance MiMo-V2.5-Pro et MiMo-V2.5 : des performances comparables aux grands modèles pour un coût en tokens bien inférieur
181MarkTechPost 

Xiaomi lance MiMo-V2.5-Pro et MiMo-V2.5 : des performances comparables aux grands modèles pour un coût en tokens bien inférieur

L'équipe MiMo de Xiaomi vient de publier deux nouveaux modèles d'intelligence artificielle, MiMo-V2.5-Pro et MiMo-V2.5, disponibles immédiatement via API à des tarifs compétitifs. Le modèle phare, MiMo-V2.5-Pro, affiche des scores de référence qui le placent aux côtés des meilleurs systèmes propriétaires actuels : 57,2 sur SWE-bench Pro, 63,8 sur Claw-Eval et 72,9 sur τ3-Bench, des résultats comparables à ceux de Claude Opus 4.6 et GPT-5.4. Pour illustrer ses capacités en conditions réelles, Xiaomi a publié trois démonstrations exigeantes : la génération d'un compilateur complet en Rust depuis zéro, inspiré d'un projet du cours de compilation de l'Université de Pékin, réalisée en 4,3 heures et 672 appels d'outils avec un score parfait de 233 sur 233 sur la suite de tests officielle ; la création d'un éditeur vidéo de bureau fonctionnel comptant 8 192 lignes de code, produit en 11,5 heures et 1 868 appels d'outils ; et une tâche de conception de circuit analogique de niveau master en EDA portant sur un régulateur LDO à suiveur de tension inversé. Ce qui distingue MiMo-V2.5-Pro des modèles classiques, c'est sa capacité à opérer de manière autonome sur des tâches longues et complexes impliquant plus d'un millier d'appels d'outils successifs. Là où la plupart des grands modèles de langage répondent à des questions isolées, les modèles dits agentiques doivent maintenir un objectif sur de nombreuses étapes, utiliser des outils comme la recherche web, l'exécution de code ou les appels d'API, et corriger leurs propres erreurs en chemin. La démonstration du compilateur Rust est particulièrement frappante : plutôt que de procéder par tâtonnements, le modèle a construit le compilateur couche par couche, atteignant dès la première compilation 137 tests réussis sur 233, soit 59% du score final avant même d'avoir lancé un seul test unitaire ciblé. Lorsque des régressions sont apparues à la suite d'un refactoring, le modèle les a diagnostiquées et corrigées de manière autonome. Xiaomi nomme cette propriété la "harness awareness" : le modèle ne suit pas les instructions mécaniquement, il optimise activement son propre environnement de travail pour rester sur la trajectoire correcte sur de très longues séquences. Ces performances s'inscrivent dans une course serrée entre modèles ouverts et systèmes propriétaires, une dynamique qui s'accélère depuis 2025. Pendant des années, les capacités agentiques les plus avancées restaient l'apanage exclusif des grands laboratoires fermés comme OpenAI, Anthropic ou Google DeepMind. L'irruption de modèles ouverts ou semi-ouverts aux performances comparables, portée par des acteurs comme Xiaomi, Meta ou DeepSeek, redistribue les cartes du secteur. Pour les développeurs et les entreprises, l'accès à des capacités de niveau frontier via des API compétitives change le calcul économique : des tâches qui nécessitaient jusqu'ici des appels coûteux à des systèmes propriétaires deviennent accessibles à moindre coût. Si MiMo-V2.5-Pro tient ses promesses en production, il pourrait accélérer significativement l'adoption de l'IA agentique dans l'ingénierie logicielle, l'automatisation industrielle et la recherche scientifique.

UELes développeurs et entreprises européens peuvent accéder à des capacités agentiques de niveau frontier via une API compétitive, réduisant le coût d'adoption de l'IA agentique dans l'ingénierie logicielle et l'automatisation industrielle.

LLMsOpinion
1 source
Alibaba ouvre l'application Qwen à des partenaires externes avec China Eastern Airlines
182SCMP Tech 

Alibaba ouvre l'application Qwen à des partenaires externes avec China Eastern Airlines

Alibaba a annoncé son premier partenariat externe pour son application grand public d'intelligence artificielle Qwen, en s'associant à China Eastern Airlines, l'une des trois grandes compagnies aériennes nationales chinoises. Grâce à cette intégration, les utilisateurs de l'application Qwen peuvent désormais gérer l'intégralité du processus de réservation de vol, recherche de billets, achat, sélection du siège et enregistrement, au sein d'une seule interface conversationnelle en langage naturel, sans quitter l'application. Ce partenariat marque une étape décisive dans la stratégie d'Alibaba : faire de Qwen non plus un simple assistant textuel, mais un agent capable d'agir concrètement dans le monde réel pour le compte de l'utilisateur. L'intégration avec China Eastern illustre ce qu'on appelle les capacités « agentiques », la possibilité pour un modèle de langage d'enchaîner des actions complexes dans des systèmes tiers. Pour les voyageurs chinois, cela représente un gain de fluidité considérable, toutes les étapes d'une réservation étant centralisées dans un seul dialogue. Cette initiative s'inscrit dans une course mondiale aux assistants IA capables de se connecter à des services réels. En Chine, Alibaba fait face à une concurrence intense de Baidu, ByteDance et surtout de DeepSeek, dont la montée en puissance a redistribué les cartes début 2025. En ouvrant Qwen à des partenaires extérieurs, Alibaba cherche à constituer un écosystème d'intégrations qui rendrait son application indispensable au quotidien, à l'image de ce que WeChat a réussi avec ses mini-programmes il y a près d'une décennie.

OutilsOutil
1 source
Ant Group lance Ling-2.6-Flash, un modèle axé sur l'efficacité des tokens
183Pandaily 

Ant Group lance Ling-2.6-Flash, un modèle axé sur l'efficacité des tokens

Ant Group, la filiale fintech du géant chinois Alibaba, a lancé Ling-2.6-Flash, un nouveau grand modèle de langage appartenant à sa série Ling. Le modèle repose sur une architecture à 104 milliards de paramètres au total, dont seulement 7,4 milliards sont activés lors de l'inférence, une approche dite MoE (Mixture of Experts) qui réduit considérablement la puissance de calcul nécessaire. Conçu comme un modèle optimisé pour les instructions, Ling-2.6-Flash mise sur ce qu'Ant Group appelle la "Token Efficiency" : délivrer des performances compétitives tout en étant plus rapide et moins coûteux que ses concurrents. Avant même son lancement officiel, une version anonyme du modèle, baptisée en interne "Elephant Alpha", avait été mise en ligne sur la plateforme OpenRouter. En quelques jours, elle s'est hissée en tête des modèles les plus utilisés, avec une consommation quotidienne d'environ 100 milliards de tokens et une croissance hebdomadaire dépassant les 5 000 %. L'adoption aussi rapide et aussi massive d'un modèle avant même son annonce officielle illustre l'appétit du marché pour des alternatives économiques aux LLMs dominants. Avec un tarif d'entrée fixé à 0,10 dollar par million de tokens en entrée et 0,30 dollar par million en sortie, Ling-2.6-Flash se positionne parmi les options les plus abordables du marché, directement en concurrence avec des modèles comme Gemini Flash de Google ou GPT-4o Mini d'OpenAI. L'API est désormais accessible publiquement, accompagnée d'une période d'essai gratuite d'une semaine. Pour les développeurs et les entreprises qui font tourner des applications à grande échelle, une telle structure tarifaire peut représenter des économies substantielles. Ce lancement s'inscrit dans une offensive plus large des acteurs technologiques chinois sur le marché mondial des LLMs. Après DeepSeek, qui avait créé la surprise début 2025 avec des modèles très compétitifs à bas coût, Ant Group entre à son tour dans la course avec une stratégie similaire : maximiser l'efficacité par dollar dépensé. La série Ling illustre la volonté du groupe de rivaliser au niveau international, au moment où la compétition entre fournisseurs de modèles s'intensifie et où la guerre des prix devient un argument commercial aussi décisif que les benchmarks de performance.

UELes développeurs et entreprises européens peuvent accéder dès maintenant à l'API Ling-2.6-Flash à 0,10 $/M tokens en entrée, une alternative économique potentiellement significative pour les applications à fort volume.

LLMsActu
1 source
Les « exportations de tokens » peuvent-elles donner un avantage à la Chine dans l'ère de l'IA ?
184SCMP Tech 

Les « exportations de tokens » peuvent-elles donner un avantage à la Chine dans l'ère de l'IA ?

Les entreprises chinoises d'intelligence artificielle s'imposent progressivement comme fournisseurs majeurs de ce que les analystes appellent des "exportations de tokens" sur le marché mondial. Selon des données couvrant la période du 18 mars au 18 avril 2026, les modèles chinois représentaient quatre des dix modèles les plus consommés en tokens sur OpenRouter, une place de marché de référence pour les développeurs. Cette présence dans le top 10 mondial illustre une percée concrète dans les usages réels, au-delà des seuls benchmarks techniques. L'enjeu dépasse la simple compétition technologique. Les tokens consommés via des modèles comme DeepSeek ou Qwen représentent une forme d'influence économique et stratégique nouvelle : chaque requête traitée par un modèle chinois génère des données d'usage, fidélise des développeurs et ancre une infrastructure logicielle dans les flux numériques mondiaux. Pour l'industrie tech mondiale, cela signifie que la domination américaine sur l'outillage IA des développeurs n'est plus acquise, et que les éditeurs comme OpenAI ou Anthropic font désormais face à une concurrence directe sur les marchés émergents et auprès des développeurs indépendants. Ce phénomène s'inscrit dans un contexte de montée en puissance accélérée des modèles chinois depuis la publication de DeepSeek-R1 début 2025, qui avait démontré qu'un modèle très compétitif pouvait être entraîné à coût réduit. La demande domestique en Chine croît également fortement, ce qui renforce la capacité des acteurs locaux à investir en R&D et à baisser leurs prix à l'export, une dynamique que Washington surveille de près dans un contexte de restrictions sur les semi-conducteurs.

UELes développeurs européens indépendants sont directement exposés à cette concurrence tarifaire, les modèles chinois comme DeepSeek ou Qwen s'imposant comme alternatives compétitives aux outils américains sur des plateformes comme OpenRouter.

BusinessOpinion
1 source
☕️ La vérification d’identité d’Anthropic limite l’accès de Claude en Chine
185Next INpact 

☕️ La vérification d’identité d’Anthropic limite l’accès de Claude en Chine

Depuis la semaine dernière, Anthropic exige de certains de ses abonnés une vérification d'identité avec pièce officielle avec photo avant de continuer à utiliser Claude. Sans détailler publiquement les critères exacts, la société américaine confirme au site The Information que la mesure vise à bloquer l'accès commercial depuis des pays considérés comme adversaires des États-Unis, notamment la Chine, la Russie et la Corée du Nord. Anthropic invoque des raisons de sécurité nationale et indique que son équipe chargée des garde-fous « applique activement ces règles » et « prend des mesures contre les comptes en infraction ». Pour l'instant, la vérification ne touche pas l'ensemble des utilisateurs chinois, mais ses effets se font déjà sentir chez les startups qui ont bâti leur activité sur l'API Claude. Sur Idle Fish, la marketplace entre particuliers du groupe Alibaba, des vendeurs proposent déjà des contournements : comptes Claude Code préenregistrés, accès à des comptes existants, ou vente de pièces d'identité étrangères. Cette décision illustre la montée en puissance des considérations géopolitiques dans l'industrie de l'IA. Anthropic rejoint ainsi OpenAI, qui restreint déjà l'accès à ChatGPT dans plusieurs pays et exclut officiellement la Chine, la Russie et la Corée du Nord de sa liste de territoires autorisés, sans toutefois avoir mis en place à ce jour de vérification d'identité formelle. Pour les entreprises technologiques chinoises qui s'appuyaient sur Claude, cette coupure représente une rupture opérationnelle réelle, les forçant soit à migrer vers d'autres modèles, soit à adopter des pratiques de contournement risquées. Plus largement, ce type de restriction tend à accélérer la fragmentation du paysage mondial de l'IA entre blocs technologiques distincts. Ce blocage s'inscrit dans un contexte de tensions croissantes entre Washington et Pékin autour des technologies d'intelligence artificielle, qui fait suite aux restrictions déjà en vigueur sur l'exportation de semi-conducteurs américains avancés vers la Chine. Ces limitations ont poussé des acteurs comme Huawei et Baidu à intensifier le développement de leurs propres puces dédiées à l'IA. La même logique s'applique aux modèles de langage : coupée des outils américains les plus performants, la Chine a accéléré la construction de ses propres alternatives, dont la plus spectaculaire reste l'émergence de DeepSeek début 2025, qui a surpris l'ensemble de l'industrie par ses capacités. Si les restrictions d'Anthropic venaient à se généraliser ou à se durcir, elles pourraient paradoxalement renforcer l'écosystème IA chinois en lui donnant une raison supplémentaire de ne plus dépendre des modèles occidentaux.

RégulationReglementation
1 source
OpenMythos : reconstruction open source de Claude Mythos en PyTorch, 770M paramètres équivalant à 1,3 milliard
186MarkTechPost 

OpenMythos : reconstruction open source de Claude Mythos en PyTorch, 770M paramètres équivalant à 1,3 milliard

Un développeur indépendant nommé Kye Gomez a publié sur GitHub un projet open-source appelé OpenMythos, une reconstruction théorique de l'architecture supposée de Claude Mythos d'Anthropic, écrite entièrement en PyTorch. Anthropic n'ayant jamais publié de documentation technique sur Mythos, Gomez a travaillé à partir de la littérature académique existante pour formuler une hypothèse concrète et vérifiable. Le projet n'est ni un modèle fuité, ni un fine-tune, ni une distillation, c'est une conjecture rendue exécutable. L'architecture proposée repose sur ce que la recherche appelle les Recurrent-Depth Transformers (RDT), également appelés Looped Transformers. Contrairement à un transformer classique comme LLaMA ou GPT, où chaque couche possède ses propres poids indépendants, un RDT applique le même bloc de poids de façon itérative, jusqu'à T=16 fois par passe. OpenMythos structure cela en trois parties : un Prélude, un Bloc Récurrent et une Coda. Le Bloc Récurrent intègre une couche Mixture-of-Experts inspirée de DeepSeekMoE, avec sélection dynamique d'experts à chaque itération, ainsi que le mécanisme Multi-Latent Attention de DeepSeek-V2, qui compresse les tenseurs KV et réduit la mémoire nécessaire d'un facteur 10 à 20. Résultat : 770 millions de paramètres qui, selon l'auteur, rivalisent avec un transformer standard de 1,3 milliard. Ce qui distingue fondamentalement cette architecture est que le raisonnement se déroule entièrement dans un espace latent continu, sans émission de tokens intermédiaires entre les étapes de boucle. Des travaux académiques récents, notamment Saunshi et al. (2025) et le projet COCONUT (2024), montrent formellement que chaque itération d'un RDT équivaut fonctionnellement à une étape de chain-of-thought, mais dans l'espace des vecteurs réels plutôt que des tokens discrets. Cette distinction est capitale : le modèle peut encoder plusieurs alternatives en parallèle à chaque passe, là où le chain-of-thought classique force un chemin unique et séquentiel. En pratique, cela permettrait d'obtenir des capacités de raisonnement profondes avec nettement moins de paramètres stockés, la profondeur étant une fonction du nombre d'itérations à l'inférence, et non de la taille du modèle. OpenMythos s'inscrit dans une tendance croissante de reverse engineering public des grands modèles propriétaires. Anthropic, comme OpenAI, publie peu sur ses choix architecturaux, ce qui pousse la communauté à reconstruire ces systèmes par inférence à partir des brevets, des papiers cités et des comportements observés. Les RDT ne sont pas nouveaux, des travaux de Universal Transformers (Dehghani et al., 2018) aux recherches récentes sur les looped networks, mais leur application à l'échelle des modèles commerciaux reste peu documentée. Si l'hypothèse de Gomez s'avère correcte ou même partiellement juste, elle aurait des implications importantes sur la façon dont l'industrie envisage le rapport entre taille de modèle et capacité de raisonnement, ouvrant potentiellement la voie à des architectures plus efficaces accessibles à des acteurs disposant de moins de ressources computationnelles.

RecherchePaper
1 source
187VentureBeat AI 

L'IA tient-elle ses promesses ? Transformer l'élan vers l'IA en valeur mesurable

Les grandes entreprises traversent aujourd'hui ce que Brian Gracely, directeur de la stratégie de portefeuille chez Red Hat, appelle le moment "Day 2" de l'intelligence artificielle : la phase où les pilotes cèdent la place à la production, et où les questions de coût, de gouvernance et de rentabilité deviennent plus complexes que la construction des systèmes eux-mêmes. Lors d'une session de l'AI Impact Tour de VentureBeat, Gracely a illustré cette réalité avec un exemple frappant : des clients qui détiennent 50 000 licences de Microsoft Copilot sans savoir précisément ce que leurs employés en tirent, tout en payant pour ce qu'il décrit comme "le calcul informatique le plus cher du monde, parce que ce sont des GPU". Après deux ou trois cycles budgétaires consacrés à l'IA générative, les directions d'entreprise ne demandent plus "peut-on construire quelque chose ?" mais "obtenons-nous ce pour quoi nous payons ?" Le problème central n'est pas seulement le coût brut de l'infrastructure GPU : c'est l'absence d'instrumentation permettant de relier les dépenses aux résultats concrets, rendant quasi impossible la justification des renouvellements de contrats à grande échelle. Cette prise de conscience provoque un changement stratégique profond dans la manière dont les entreprises envisagent leur rapport à l'IA. Le modèle dominant des deux dernières années, payer un fournisseur au token, au siège ou à l'appel API en lui déléguant toute l'infrastructure, est de plus en plus remis en question. Gracely résume cette évolution : plutôt que d'être purement "consommateur de tokens", certaines organisations cherchent à devenir "productrices de tokens", en évaluant quels usages justifient de posséder ou louer directement des GPU, et si les cas d'usage nécessitent vraiment les modèles les plus avancés ou si des modèles ouverts plus légers suffisent. Cette décision n'est pas binaire : elle dépend de la tolérance au risque, de la nature des charges de travail et de la maturité de chaque organisation. Le paradoxe auquel font face les responsables financiers est bien réel. Le PDG d'Anthropic, Dario Amodei, a estimé que les coûts d'inférence chutent d'environ 60 % par an, et l'émergence de modèles open source comme DeepSeek a considérablement élargi les alternatives stratégiques disponibles. Pourtant, la baisse du coût unitaire ne se traduit pas par une réduction des factures totales : l'usage s'accélère à un rythme qui compense largement les gains d'efficacité. C'est une manifestation du paradoxe de Jevons, principe économique selon lequel l'amélioration de l'efficacité d'une ressource tend à augmenter sa consommation globale plutôt qu'à la réduire. Une entreprise qui triple son utilisation de l'IA pendant que les coûts diminuent de moitié dépense encore davantage qu'avant. Pour les décideurs, cela signifie que la maturité de l'IA en entreprise passe désormais par une discipline opérationnelle rigoureuse, et non plus par l'enthousiasme des premières expérimentations.

BusinessOpinion
1 source
188MarkTechPost 

MIT, NVIDIA et Zhejiang University proposent TriAttention, une compression du cache KV à débit 2,5 fois supérieur

Des chercheurs du MIT, de NVIDIA et de l'université du Zhejiang ont présenté TriAttention, une nouvelle méthode de compression du cache KV qui résout l'un des goulots d'étranglement les plus critiques des grands modèles de langage actuels. Publiés dans un article disponible sur arXiv (référence 2504.04921), leurs travaux montrent que TriAttention atteint la même précision que l'attention complète sur le benchmark de raisonnement mathématique AIME25 avec des séquences de 32 000 tokens, tout en offrant un débit 2,5 fois supérieur ou une réduction de la mémoire KV d'un facteur 10,7. Les meilleures méthodes concurrentes, comme SnapKV, H2O ou R-KV, n'atteignent qu'environ la moitié de cette précision pour un niveau d'efficacité équivalent. L'enjeu est considérable pour tous ceux qui déploient des modèles de raisonnement avancés comme DeepSeek-R1 ou Qwen3. Ces modèles peuvent générer des dizaines de milliers de tokens avant de produire une réponse, et chaque token doit être stocké dans le cache KV, une structure mémoire qui grossit jusqu'à saturer complètement la mémoire GPU sur du matériel grand public. Les méthodes existantes tentent de compresser ce cache en évictant les tokens jugés peu importants, mais elles opèrent dans l'espace post-RoPE, après application du schéma d'encodage positionnel rotatif utilisé par la quasi-totalité des LLM modernes (Llama, Qwen, Mistral). Ce mécanisme fait pivoter les vecteurs Query et Key selon la position, rendant les requêtes anciennes inutilisables pour estimer l'importance des tokens récents. La fenêtre d'observation efficace se réduit alors à environ 25 requêtes, ce qui conduit à l'éviction définitive de tokens qui deviendront pourtant essentiels plus tard dans la chaîne de raisonnement. L'innovation de TriAttention repose sur une observation faite dans l'espace pré-RoPE, avant que la rotation positionnelle ne soit appliquée. Les chercheurs ont constaté que sur Qwen3-8B, environ 90 % des têtes d'attention présentent un indice de concentration R supérieur à 0,95, signifiant que leurs vecteurs Query et Key se regroupent de façon quasi parfaite autour de centres fixes et stables, indépendants de la position ou de la séquence d'entrée. Cette propriété, qu'ils appellent concentration Q/K, permet d'estimer la pertinence des tokens sans être perturbé par l'encodage positionnel. Le résultat est particulièrement important pour les têtes de récupération, ces composants spécialisés dans l'extraction d'informations factuelles précises depuis de longs contextes, qui étaient les premières victimes des méthodes post-RoPE. En préservant les tokens réellement utiles sur l'ensemble de la fenêtre de contexte, TriAttention maintient l'intégrité des longues chaînes de pensée là où les approches précédentes échouaient.

RecherchePaper
1 source
HappyHorse : l’IA vidéo qui domine les réseaux sociaux appartient en fait à Alibaba
189Le Big Data 

HappyHorse : l’IA vidéo qui domine les réseaux sociaux appartient en fait à Alibaba

Le vendredi 10 avril 2026, Alibaba a officiellement revendiqué la paternité de HappyHorse-1.0, le modèle d'intelligence artificielle génératrice de vidéos qui avait envahi les réseaux sociaux et les plateformes de benchmark en l'espace de quelques jours. L'annonce est tombée via un post sur X signé par l'équipe du projet, confirmant que le modèle est développé au sein de l'unité ATH AI Innovation Unit, rattachée au géant chinois du e-commerce. Apparu début avril sans affiliation déclarée, HappyHorse-1.0 avait immédiatement pris la première place du classement text-to-video d'Artificial Analysis, devançant des modèles soutenus par des acteurs majeurs de l'industrie. Ses capacités couvrent aussi bien la génération vidéo à partir de texte que la création d'images animées, deux segments très convoités du marché. Le modèle se trouve encore en phase de test bêta, mais un accès via API est annoncé prochainement pour les développeurs. La révélation a eu un effet immédiat sur les marchés : l'action Alibaba a clôturé en hausse de 2,12 % à Hong Kong le jour de l'annonce, après avoir déjà bondi de plus de 6 % deux jours plus tôt, quand les premières spéculations sur l'origine du modèle avaient circulé. Cette réaction boursière illustre l'importance stratégique que les investisseurs accordent désormais aux capacités IA des grandes entreprises technologiques chinoises. Pour Alibaba, HappyHorse représente une validation publique et quantifiable de la stratégie portée par Eddie Wu, le dirigeant qui a fait de l'intelligence artificielle la priorité absolue du groupe depuis son arrivée à la tête de l'entreprise. Un succès technique aussi visible, obtenu en quelques jours sur des benchmarks internationaux, constitue un signal fort envoyé à la fois aux concurrents américains et aux investisseurs mondiaux. Ce lancement intervient dans un moment de turbulences pour le secteur de la vidéo IA. OpenAI a récemment réduit la place de Sora dans sa stratégie globale, préférant concentrer ses ressources sur d'autres usages. ByteDance, de son côté, fait face à des controverses autour de ses outils vidéo expérimentaux, notamment sur des questions de droits d'auteur. Dans ce contexte, Alibaba choisit de s'imposer avec un modèle performant, lancé de façon discrète puis révélé au bon moment, une mécanique de communication qui rappelle les stratégies adoptées par DeepSeek lors de la publication de ses modèles. Le fait qu'un acteur chinois prenne la tête des classements mondiaux sur un segment aussi compétitif que la génération vidéo soulève des questions sur l'équilibre des forces dans la course à l'IA générative, et annonce probablement une intensification de la rivalité technologique entre Pékin et la Silicon Valley.

CréationOpinion
1 source
190Siècle Digital 

Sam Altman fragilisé par une enquête explosive du New Yorker au pire moment pour OpenAI

Ronan Farrow et Andrew Marantz ont publié dans le New Yorker une enquête approfondie sur Sam Altman, présentée comme la dissection la plus documentée jamais réalisée sur le PDG d'OpenAI. Le texte paraît à un moment particulièrement délicat : OpenAI affiche une valorisation de 852 milliards de dollars, mais sa propre directrice financière a jugé une introduction en Bourse compromise pour l'année en cours, tandis que la croissance de l'entreprise montre des signes de ralentissement. Le timing est stratégiquement désastreux pour OpenAI. Une enquête de cette envergure, signée par Ronan Farrow, journaliste connu pour ses révélations ayant contribué au mouvement #MeToo, amplifie les doutes des investisseurs institutionnels déjà préoccupés par la trajectoire financière de l'entreprise. Pour une société qui cherche à convaincre les marchés de sa solidité avant une éventuelle cotation, les révélations sur son dirigeant alimentent l'incertitude au pire moment, fragilisant la confiance indispensable à une opération de cette échelle. OpenAI traverse depuis plusieurs mois une période de turbulences : départs de cadres clés, tensions internes sur la direction stratégique, et pression croissante des concurrents comme Google DeepMind, Anthropic ou les acteurs chinois tels que DeepSeek. Sam Altman, déjà brièvement évincé fin 2023 avant d'être rétabli dans ses fonctions, voit son autorité de nouveau mise en question. L'enquête du New Yorker pourrait accélérer les interrogations sur la gouvernance d'OpenAI et sur la capacité d'Altman à piloter une entreprise aux ambitions aussi colossales.

BusinessOpinion
1 source
L'ambiance est mauvaise chez OpenAI
191The Verge AI 

L'ambiance est mauvaise chez OpenAI

OpenAI traverse une période de turbulences malgré des indicateurs financiers record. Il y a moins de deux semaines, la société a bouclé une levée de fonds de 122 milliards de dollars, portant sa valorisation post-money à 852 milliards de dollars, ce qui en fait l'une des startups les mieux financées de l'histoire. L'entreprise envisage également une introduction en bourse avant la fin de l'année. ChatGPT, son produit phare, a atteint un statut de marque générique comparable à "Kleenex" dans l'univers de l'IA grand public. Pourtant, ces chiffres impressionnants masquent des signaux d'instabilité préoccupants. Ces derniers mois, OpenAI a connu une série de départs et remaniements au sein de sa direction, des projets abandonnés en cours de route, et une accumulation de controverses publiques qui alimentent les doutes sur la solidité interne de la structure. Pour une entreprise en phase de préparation d'IPO, cette image de désordre organisationnel est un facteur de risque non négligeable aux yeux des investisseurs institutionnels. Les tensions remontent au début de l'année et s'inscrivent dans un contexte de pression concurrentielle accrue. Des acteurs comme Google DeepMind, Anthropic, Meta et des challengers chinois tels que DeepSeek bousculent la domination historique d'OpenAI. La question n'est plus seulement de savoir si la valorisation est justifiée, mais si l'entreprise peut maintenir sa cohésion stratégique et humaine au moment même où elle s'apprête à franchir le cap de la cotation publique.

BusinessOpinion
1 source
L'impact de l'IA sur l'emploi et les centres de données dans l'espace
192MIT Technology Review 

L'impact de l'IA sur l'emploi et les centres de données dans l'espace

L'intelligence artificielle continue de redistribuer les cartes de l'économie mondiale, et les économistes qui minimisaient jusqu'ici ses effets sur l'emploi commencent à revoir leur position. Alex Imas, chercheur à l'Université de Chicago, avance qu'un seul indicateur pourrait réellement éclairer l'ampleur de la transformation à venir : l'élasticité-prix du travail face à l'automatisation. Il plaide pour ce qu'il appelle un "Projet Manhattan" de la collecte de données, afin de mesurer dans quelle mesure les entreprises substitueront effectivement des travailleurs humains à des systèmes d'IA selon l'évolution des coûts. Sans cette donnée, toute politique publique visant à amortir le choc risque de viser à l'aveugle. En parallèle, un rapport explosif du New Yorker révèle que Sam Altman aurait discrètement lobbié contre des réglementations sur l'IA qu'il soutenait publiquement, alimentant la méfiance d'une partie des cadres d'OpenAI envers leur propre PDG. La société fait également face à des doutes sur sa capacité à entrer en Bourse cette année, selon The Information. Ces bouleversements interviennent alors que l'industrie technologique explore des solutions infrastructurelles radicales pour soutenir la croissance de l'IA sans aggraver la crise environnementale terrestre. En janvier 2026, SpaceX d'Elon Musk a déposé une demande pour lancer jusqu'à un million de centres de données en orbite autour de la Terre. L'objectif affiché est de libérer pleinement le potentiel de l'IA tout en délocalisant hors de notre planète la consommation énergétique et thermique colossale que ces infrastructures impliquent. SpaceX n'est pas seule sur ce créneau : plusieurs autres entreprises technologiques explorent des solutions similaires d'informatique orbitale, même si les défis techniques restent considérables. Ce double mouvement, vers une IA plus puissante et vers une infrastructure toujours plus ambitieuse, se déploie dans un contexte géopolitique tendu. L'administration Trump a proposé des coupes massives dans le financement des agences scientifiques américaines, ce qui pourrait provoquer une fuite des cerveaux hors des États-Unis selon le New York Times. Pendant ce temps, OpenAI, Anthropic et Google ont formé une alliance inhabituelle pour contrer ce que Bloomberg décrit comme de la "distillation adversariale" par des acteurs chinois, c'est-à-dire l'extraction des capacités de leurs modèles par imitation. DeepSeek, de son côté, préparerait un nouveau modèle optimisé pour fonctionner sur des puces Huawei, attendu dans les prochaines semaines. Ces dynamiques dessinent un paysage où la course à l'IA se joue désormais autant sur le terrain économique et réglementaire que sur celui de la recherche pure.

UELes coupes budgétaires américaines dans les agences scientifiques pourraient provoquer une fuite des chercheurs vers l'Europe, tandis que l'alliance OpenAI-Anthropic-Google contre la distillation adversariale chinoise soulève des questions de souveraineté numérique pour les acteurs européens de l'IA.

SociétéActu
1 source
NVIDIA AI présente ProRL Agent : une infrastructure d'apprentissage par renforcement pour agents LLM à grande échelle
193MarkTechPost 

NVIDIA AI présente ProRL Agent : une infrastructure d'apprentissage par renforcement pour agents LLM à grande échelle

NVIDIA a présenté ProRL Agent, une infrastructure open source conçue pour entraîner des agents LLM multi-tours par apprentissage par renforcement (RL) à grande échelle. Publiée via un article de recherche (arXiv:2603.18815), cette solution adopte une philosophie « Rollout-as-a-Service » : le service de rollout fonctionne comme un serveur HTTP autonome, totalement découplé de la boucle d'entraînement. Le système s'appuie sur un pipeline asynchrone en trois étapes, initialisation des environnements sandbox, exécution des trajectoires d'agent, évaluation des résultats, chaque étape disposant de son propre pool de workers pour maximiser le débit. Pour la compatibilité avec les clusters HPC sous Slurm, ProRL Agent utilise Singularity plutôt que Docker, permettant une exécution sans droits root. Des optimisations de bas niveau réduisent drastiquement la latence des outils : remplacement de tmux par un terminal pseudo-TTY direct (latence bash réduite de 0,78 s à 0,42 s), connexion directe aux kernels IPython via API in-process, et remplacement du TCP par des sockets Unix pour la communication interne aux conteneurs. Le problème que résout cette architecture est fondamental pour quiconque entraîne des agents LLM modernes : les tâches multi-tours impliquent des interactions répétées avec des environnements externes (dépôts de code, systèmes d'exploitation, outils) qui sont intensives en I/O, tandis que la mise à jour du modèle est intensive en GPU. Les frameworks existants, SkyRL, VeRL-Tool, Agent Lightning, rLLM, GEM, fusionnent ces deux phases dans un même processus, créant des conflits de ressources qui dégradent l'efficacité matérielle et compliquent la maintenance. ProRL Agent élimine ces interférences en rendant le trainer entièrement agnostique à l'infrastructure de rollout, et introduit en prime un mécanisme de réutilisation du cache de préfixes via un load balancer min-heap sur les backends vLLM, accélérant l'inférence sur les longues séquences multi-tours. Autre innovation notable : la communication en token IDs de bout en bout, qui évite les dérives de re-tokenisation entre rollout et training, une source de bugs silencieux dans les pipelines RL existants. Ce travail s'inscrit dans une course industrielle intense pour rendre l'entraînement RL des agents LLM praticable à l'échelle. Depuis les succès de DeepSeek-R1 et des modèles de raisonnement d'OpenAI, le RL appliqué aux LLM est devenu un axe stratégique majeur, mais les infrastructures peinent à suivre la complexité des tâches agentiques longues. NVIDIA, avec ses GPU dominants dans les data centers, a un intérêt direct à proposer des solutions qui maximisent l'utilisation de son matériel. ProRL Agent inclut également une implémentation optimisée de DAPO (Dynamic Advantage Policy Optimization), un algorithme récent qui améliore la stabilité de l'entraînement. La prochaine étape sera de voir si cette infrastructure est adoptée par la communauté de recherche ou si elle reste un outil interne à NVIDIA pour ses propres expérimentations sur les agents autonomes.

RecherchePaper
1 source
Les prix des H100 s'envolent
194Latent Space 

Les prix des H100 s'envolent

Depuis décembre 2025, les prix de location des GPU H100 de Nvidia repartent fortement à la hausse, effaçant la correction observée début 2025 après le choc DeepSeek R1. Selon le commentateur Dylan sur le podcast Dwarkesh, les H100 valent aujourd'hui davantage qu'il y a trois ans, au moment de leur lancement. Cette inversion de tendance intervient alors que la plupart des acteurs du secteur tablaient sur une dépréciation progressive sur quatre à sept ans. Les raisons avancées sont multiples : une pénurie générale de puces haut de gamme, l'émergence des modèles de raisonnement de décembre 2025, et l'amélioration spectaculaire des logiciels d'inférence, qui rendent une puce de quatre ans beaucoup plus efficace qu'elle ne l'était à sa sortie. Ce retournement a des implications directes sur la rentabilité des centres de données spécialisés en IA. Les modèles économiques construits sur l'hypothèse d'une dépréciation rapide du matériel se trouvent bousculés : un H100 loué plus cher que prévu change profondément les équations de coût par token pour les opérateurs cloud et les startups qui ne possèdent pas leur propre infrastructure. En parallèle, Anthropic serait sur le point de bénéficier d'un financement de Google pour la construction d'un centre de données, selon le Financial Times, ce qui illustre que la compétition frontier est désormais autant une question de capacité électrique et de capital que d'algorithmes. Ce contexte tendu se double d'une semaine chargée pour Anthropic : une fuite interne sur un système baptisé « Claude Mythos » a révélé l'existence d'un nouveau niveau d'abonnement nommé Capybara, décrit comme supérieur à Claude Opus 4.6, plus grand et plus intelligent, avec des scores nettement améliorés en programmation, raisonnement académique et cybersécurité. Le déploiement serait freiné par des contraintes de coût et de sécurité, et la spéculation va bon train autour d'un modèle de classe 10 000 milliards de paramètres évoqué par le PDG Dario Amodei. Pendant ce temps, côté open source, Zhipu a ouvert l'accès à GLM-5.1 à tous les utilisateurs de son offre coding, et la communauté constate que l'écart entre modèles fermés et ouverts n'a jamais été aussi réduit. Des utilisateurs rapportent avoir remplacé des abonnements TTS payants par des modèles locaux comme Qwen 3.5 14B, ou avoir fait tourner Qwen3.5-35B dans 24 Go de VRAM avec seulement 1 % de perte de performance grâce à la quantification, signe que l'économie de l'inférence locale devient viable pour un nombre croissant de cas d'usage professionnels.

UELa hausse des prix des H100 alourdit les coûts d'exploitation des opérateurs cloud et startups européens sans infrastructure propre, fragilisant les modèles économiques construits sur une dépréciation rapide du matériel.

InfrastructureActu
1 source
IndexCache accélère l'inférence des modèles IA sur longs contextes de 1,82x grâce à une attention clairsemée
195VentureBeat AI 

IndexCache accélère l'inférence des modèles IA sur longs contextes de 1,82x grâce à une attention clairsemée

Des chercheurs de l'Université Tsinghua et de Z.ai ont mis au point une technique appelée IndexCache, capable d'accélérer jusqu'à 1,82 fois le temps de génération du premier token et d'augmenter de 1,48 fois le débit de génération pour des contextes de 200 000 tokens. Concrètement, IndexCache supprime jusqu'à 75 % des calculs redondants dans les modèles d'attention sparse, et s'applique aux architectures utilisant DeepSeek Sparse Attention (DSA), notamment les familles de modèles DeepSeek et GLM. Des tests préliminaires ont déjà été conduits sur GLM-5, un modèle de 744 milliards de paramètres, avec des résultats probants en conditions de production. Cette optimisation répond à un problème fondamental des grands modèles de langage : le mécanisme d'auto-attention, qui calcule les relations entre chaque token et tous les précédents, voit sa complexité computationnelle croître de façon quadratique avec la longueur du contexte. L'attention sparse, dont DSA est une implémentation efficace introduite avec DeepSeek-V3.2, résout en partie ce problème en ne traitant qu'un sous-ensemble de tokens pertinents, réduisant la complexité de quadratique à linéaire. Mais les chercheurs ont identifié un goulot d'étranglement résiduel : le module d'indexation léger présent à chaque couche du modèle, chargé de sélectionner ces tokens importants, restait lui-même quadratique, ralentissant considérablement la phase de préfill lors du traitement initial du prompt. IndexCache s'attaque précisément à ce verrou en exploitant une propriété empirique : les couches adjacentes du transformer sélectionnent entre 70 % et 100 % des mêmes tokens. Le système désigne donc un petit nombre de couches "complètes" qui calculent et mettent en cache les indices de tokens, tandis que les couches "partagées" réutilisent simplement ces indices sans recalcul. Contrairement aux techniques classiques de compression du KV cache qui visent à réduire l'empreinte mémoire, IndexCache attaque directement le coût computationnel. L'enjeu est considérable pour les entreprises qui déploient des modèles à grande échelle. Le traitement de longs contextes, documents volumineux, workflows agentiques multi-étapes, raisonnements en chaîne de pensée étendue, représente aujourd'hui l'un des principaux freins économiques à l'adoption des LLM en production, où chaque milliseconde et chaque token coûtent. La course à l'efficacité de l'inférence s'est intensifiée ces derniers mois, avec des approches concurrentes comme la distillation de modèles, la quantification ou la compression du KV cache. IndexCache se positionne comme une technique orthogonale et complémentaire, exploitable sans modification de l'architecture de base. Avec DeepSeek déjà en pointe sur l'optimisation des coûts d'inférence et Z.ai directement impliqué dans ces travaux, la technique a de bonnes chances d'être intégrée rapidement dans les prochaines versions des modèles GLM et DeepSeek, élargissant la fenêtre de contexte praticable sans explosion des coûts.

UELes entreprises et laboratoires européens déployant des modèles DeepSeek ou GLM pourraient bénéficier de gains d'efficacité substantiels sur les inférences longues, réduisant les coûts opérationnels sans modification d'architecture.

RecherchePaper
1 source
En plein doute sur l’IA, Trump crée un « Conseil des Sages » avec Mark Zuckerberg et Jensen Huang
196Presse-citron 

En plein doute sur l’IA, Trump crée un « Conseil des Sages » avec Mark Zuckerberg et Jensen Huang

Donald Trump vient de franchir un pas décisif dans sa politique technologique en créant un « Conseil des Sages » dédié à la science et à la technologie, avec à sa tête des figures emblématiques de l'industrie dont Mark Zuckerberg (Meta) et Jensen Huang (NVIDIA). Cette initiative intervient dans un contexte de questionnements croissants sur la stratégie américaine en matière d'intelligence artificielle. Ce conseil consultatif représente un tournant dans la relation entre la Maison-Blanche et la Silicon Valley. Si ce type d'organe a déjà existé par le passé sous d'autres administrations, c'est la première fois qu'il est aussi explicitement orienté vers la tech et l'IA, un signal fort que Washington entend peser directement sur l'orientation stratégique du secteur, dans un contexte de rivalité intense avec la Chine. La composition du conseil est particulièrement significative : en choisissant Jensen Huang, patron de NVIDIA dont les puces sont au cœur de la course aux modèles d'IA, et Mark Zuckerberg, qui a massivement investi dans l'IA générative chez Meta, Trump s'entoure des acteurs les plus influents de l'infrastructure et des applications IA mondiales. Cette proximité inédite entre le pouvoir exécutif et les grandes entreprises technologiques soulève des questions sur les conflits d'intérêts potentiels. La création de ce conseil s'inscrit dans un moment de doute stratégique américain, notamment après l'irruption de DeepSeek sur la scène mondiale, qui a remis en cause la suprématie technologique des États-Unis. La Maison-Blanche cherche visiblement à structurer une réponse coordonnée entre secteur public et privé pour maintenir le leadership américain en IA.

UEUne coordination renforcée entre l'administration américaine et les géants de la tech pourrait accélérer la course aux standards mondiaux de l'IA et compliquer la position européenne dans les négociations réglementaires internationales.

RégulationReglementation
1 source
19701net 

Le mystérieux modèle IA de Xiaomi égale les géants américains pour un prix dérisoire

Xiaomi vient de lever le voile sur un modèle d'intelligence artificielle qui a brièvement déstabilisé la Silicon Valley avant que son origine ne soit identifiée. Apparu discrètement sur les benchmarks, ce modèle inconnu affichait des performances comparables aux meilleurs systèmes américains, provoquant une onde de choc dans un secteur habitué à dominer sans partage. L'offensive de Xiaomi s'inscrit dans une tendance lourde : après DeepSeek et Alibaba, c'est au tour du géant chinois des smartphones de démontrer que la course à l'IA n'est plus le monopole des acteurs américains. Ce qui frappe ici, c'est moins la performance brute que le rapport coût-efficacité, un argument massue à l'heure où OpenAI, Google et Anthropic dépensent des dizaines de milliards de dollars en infrastructure. Le modèle de Xiaomi rivaliserait avec les références du marché pour une fraction du coût de développement habituellement requis. Cette démonstration de force rappelle la secousse provoquée par DeepSeek R1 en janvier 2025, qui avait fait plonger les valeurs technologiques américaines en bourse. L'approche chinoise, optimiser l'efficacité plutôt qu'augmenter la puissance de calcul, semble désormais constituer une stratégie à part entière. Si Xiaomi confirme ses ambitions dans l'IA au même niveau que ses concurrents d'hardware, cela pourrait redistribuer les cartes sur le marché des modèles embarqués dans les appareils mobiles et connectés, un terrain sur lequel le groupe est déjà en position de force avec des centaines de millions d'appareils vendus chaque année.

LLMsActu
1 source
198TechCrunch AI 

Multiverse Computing propulse ses modèles d'IA compressés vers le grand public

Multiverse Computing franchit une nouvelle étape dans la démocratisation de l'intelligence artificielle en rendant accessibles au grand public ses modèles compressés issus des plus grands laboratoires de l'IA mondiale. La société a lancé simultanément une application grand public et une API permettant d'exploiter ces modèles allégés à plus grande échelle. La compression de modèles représente un enjeu stratégique majeur pour le secteur : en réduisant la taille des modèles sans sacrifier leurs performances, elle permet de les déployer sur des infrastructures moins coûteuses, de diminuer la consommation énergétique et d'élargir l'accès à des acteurs qui ne disposent pas de ressources de calcul massives. La démarche de Multiverse Computing s'inscrit ainsi dans une tendance de fond visant à rendre l'IA haute performance plus accessible et plus frugale. Les modèles compressés proposés par la société sont issus de quatre des acteurs les plus influents du domaine : OpenAI, Meta, DeepSeek et Mistral AI. L'application dévoilée permet de démontrer concrètement les capacités de ces versions optimisées, tandis que l'API ouvre la voie à une intégration par des développeurs et des entreprises souhaitant bénéficier de ces modèles sans les contraintes habituelles de déploiement. Cette double mise sur le marché, application et API, suggère que Multiverse Computing mise sur deux segments distincts : les utilisateurs finaux curieux d'évaluer les modèles compressés, et les professionnels cherchant à les intégrer dans leurs propres produits. La stratégie pourrait repositionner la compression de modèles non plus comme un simple outil d'optimisation interne, mais comme une offre commerciale à part entière.

UEMultiverse Computing, entreprise européenne spécialisée dans la compression de modèles IA, rend ses outils accessibles via une API — opportunité directe pour les développeurs et entreprises européennes cherchant à réduire les coûts d'inférence.

OutilsOutil
1 source
La Chine soutient les micro-entreprises OpenClaw avec des millions de subventions dédiées aux agents IA
199The Decoder 

La Chine soutient les micro-entreprises OpenClaw avec des millions de subventions dédiées aux agents IA

La Chine accélère son soutien aux entreprises basées sur l'intelligence artificielle avec une initiative inédite : au moins sept gouvernements locaux ont lancé en quelques jours des programmes de financement de plusieurs millions de dollars ciblant les projets OpenClaw. L'objectif affiché est de favoriser l'émergence d'entreprises ultralegères, où un seul fondateur pilote une activité entière en s'appuyant sur des agents IA comme substituts aux employés traditionnels. Ce modèle, baptisé "entreprise unipersonnelle" (one-person company), représente une rupture conceptuelle majeure dans l'organisation du travail. Là où une startup classique nécessite des équipes, des fonctions support et une masse salariale, ce nouveau paradigme mise sur des agents autonomes capables d'assurer des tâches opérationnelles, gestion, communication, production de contenu ou analyse, sous la supervision d'un unique dirigeant humain. L'enjeu pour Pékin est double : stimuler l'innovation locale tout en positionnant la Chine comme pionnière dans l'adoption industrielle des agents IA. Les subventions, débloquées simultanément par plusieurs collectivités territoriales chinoises, illustrent la coordination rapide des pouvoirs publics autour de la filière IA agentique. Cette mobilisation intervient dans un contexte de concurrence technologique intense avec les États-Unis, et suit de près les avancées de projets comme DeepSeek qui ont renforcé la confiance des autorités dans la capacité de l'écosystème national à produire des modèles compétitifs. Le cadre OpenClaw semble constituer le véhicule institutionnel choisi pour canaliser ces ambitions. Cette dynamique pourrait préfigurer un nouveau modèle économique à l'échelle mondiale, où les barrières à l'entrée entrepreneuriale s'effondrent grâce aux agents IA. Si l'initiative chinoise fait figure de laboratoire grandeur nature, d'autres pays observent avec attention ses résultats, notamment en termes d'emploi, de productivité et de régulation du travail automatisé.

BusinessActu
1 source
Un printemps pour les LLMs open-weight : 10 architectures (jan-fév 2026)
200Ahead of AI 

Un printemps pour les LLMs open-weight : 10 architectures (jan-fév 2026)

Entre janvier et février 2026, une vague exceptionnelle de modèles de langage open-weight a déferlé sur la communauté IA, avec dix architectures majeures publiées en l'espace de trois semaines. Parmi les sorties les plus remarquées : Trinity Large d'Arcee AI (27 janvier), Kimi K2.5 de Moonshot AI (27 janvier), Step 3.5 Flash de StepFun (1er février), Qwen3-Coder-Next (3 février), GLM-5 de z.AI et MiniMax M2.5 (12 février), Nanbeige 4.1 3B (13 février), Qwen 3.5 (15 février), les modèles Ling 2.5 et Ring 2.5 à 1 000 milliards de paramètres d'Ant Group (16 février), et enfin Tiny Aya de Cohere (17 février). Le modèle phare de cette période reste Trinity Large d'Arcee AI : un Mixture-of-Experts de 400 milliards de paramètres, dont seulement 13 milliards sont activés à chaque inférence, accompagné de deux variantes plus légères, Trinity Mini (26B/3B actifs) et Trinity Nano (6B/1B actifs). Arcee AI a publié les poids du modèle ainsi qu'un rapport technique détaillé, d'abord sur GitHub puis sur arXiv à partir du 18 février. Cette effervescence illustre une démocratisation accélérée des modèles de grande taille : des entreprises jusqu'ici discrètes, comme Arcee AI, publient désormais des architectures compétitives avec les géants comme z.AI et son GLM-4.5 (355 milliards de paramètres). Sur le plan technique, Trinity Large rivalise avec GLM-4.5 en performances sur les modèles de base, une parité remarquable pour une start-up américaine encore peu connue. Ces modèles open-weight permettent à des équipes de recherche, des entreprises et des développeurs indépendants de déployer des LLMs puissants sans dépendre des API commerciales fermées, ce qui réduit les coûts et augmente la souveraineté technologique. Sur le plan architectural, cette génération de modèles converge vers plusieurs innovations communes. L'attention à fenêtre glissante (sliding window attention, SWA), qui réduit le coût computationnel de O(n²) à O(n·t) en limitant chaque token à une fenêtre locale fixe, est adoptée par Trinity, Gemma 3, OLMo 3 ou encore Xiaomi MiMo. Trinity opte pour un ratio local:global de 3:1 avec une fenêtre de 4 096 tokens. L'architecture intègre également le QK-Norm (normalisation des clés et requêtes pour stabiliser l'entraînement), l'absence d'encodage positionnel dans les couches d'attention globale (NoPE), et un mécanisme de gating sur l'attention qui réduit les "attention sinks" et améliore la généralisation sur les longues séquences. Ces choix architecturaux convergents signalent une forme de consensus émergeant dans la communauté open-weight sur les meilleures pratiques pour les modèles à très long contexte, une tendance qui devrait s'accentuer avec les prochaines sorties, dont DeepSeek V4, attendu prochainement.

UELes équipes de recherche et entreprises européennes peuvent déployer ces modèles open-weight puissants sans dépendre des API commerciales fermées, réduisant les coûts et renforçant leur souveraineté technologique.

LLMsActu
1 source