Aller au contenu principal

Actualités IA — page 114

7 616 articles au fil, du plus récent au plus ancien.

AMD : ce mini PC fait tourner des IA géantes… sans cloud ni abonnement
2261Le Big Data 

AMD : ce mini PC fait tourner des IA géantes… sans cloud ni abonnement

Lors de la conférence Computex 2026, Lisa Su, PDG d'AMD, a pris la scène avec un mini PC pas plus grand qu'un livre épais pour y faire tourner en direct un modèle d'intelligence artificielle de 235 milliards de paramètres, sans datacenter, sans cloud, sans carte graphique dédiée externe. La machine utilisée est équipée du processeur Ryzen AI Max+ 395 (nom de code Strix Halo), intégré notamment dans le GMKtec EVO-X2. Sa particularité tient à son architecture de mémoire unifiée : jusqu'à 128 Go de RAM partagée, dont 96 Go peuvent être alloués au GPU intégré en guise de VRAM. C'est précisément ce volume qui permet de charger des modèles d'une taille normalement réservée aux serveurs professionnels. Le tout s'exécute via des outils open source gratuits comme Ollama, sans abonnement ni limite d'usage imposée par un tiers. Ce qui change concrètement, c'est la barrière d'accès à l'inférence locale de très grands modèles. Jusqu'ici, faire tourner un LLM de plusieurs dizaines de milliards de paramètres exigeait soit une carte graphique haut de gamme à plusieurs milliers d'euros avec ses limitations de VRAM, soit la location de GPU dans le cloud, une facture récurrente qui peut vite peser sur les marges d'un indépendant ou d'une petite structure. AMD montre ici qu'un mini PC compact peut absorber ces charges de travail localement. Pour les entreprises manipulant des données sensibles, cabinets juridiques, services de santé, bureaux d'études, la promesse est double : confidentialité totale des documents traités et réduction significative des coûts d'infrastructure IA. Un consultant cité dans la démonstration affirme avoir remplacé ses locations de GPU par cette configuration, avec un impact positif sur la rentabilité de son activité. AMD ne part pas de zéro dans cette course, mais accuse encore du retard sur Nvidia. Son écosystème logiciel ROCm, équivalent maison du CUDA de Nvidia, progresse rapidement en compatibilité mais n'a pas encore atteint la maturité de son concurrent, ce qui peut freiner certains workflows spécialisés. Face à une RTX 5090, les performances de ce Ryzen AI Max+ 395 restent inférieures sur les modèles les plus exigeants. La démonstration d'AMD s'inscrit néanmoins dans une tendance de fond : la décentralisation de l'IA vers le matériel personnel, portée aussi bien par Apple Silicon que par les puces NPU embarquées dans les PC Copilot+. Le marché de l'IA embarquée représente un enjeu stratégique majeur pour les prochaines années, et cette annonce positionne AMD comme un acteur sérieux de l'inférence locale, aux côtés d'un Nvidia dont la domination sur le segment serveur reste, pour l'instant, intacte.

InfrastructureOpinion
1 source
Guide Claude Code 2026 : 25 fonctionnalités avec exemples et démo
2262MarkTechPost 

Guide Claude Code 2026 : 25 fonctionnalités avec exemples et démo

Un guide complet des 25 fonctionnalités de Claude Code a été publié à destination des ingénieurs IA, développeurs et data scientists, détaillant comment l'outil d'Anthropic a évolué d'un simple assistant en ligne de commande vers un système agentique structuré en couches. L'outil fonctionne dans le terminal, l'application desktop et les IDE, s'appuyant sur une boucle agentique capable de lire des fichiers, exécuter des commandes, modifier du code et appeler des outils externes. Cette architecture s'articule autour de primitives distinctes : les fichiers CLAUDE.md (constitution du projet lue à chaque session), les skills (fichiers SKILL.md invocables via une commande /nom), les sous-agents (instances spécialisées avec leurs propres fenêtres de contexte), les slash commands intégrées comme /init, /compact ou /review, les hooks (scripts déterministes déclenchés à des points précis du cycle de vie), et les serveurs MCP (Model Context Protocol) pour connecter Claude Code à GitHub, des bases de données ou des navigateurs. Les plugins regroupent l'ensemble en un bundle versionné installable en une commande. S'ajoutent des fonctionnalités comme les checkpoints automatiques avec retour arrière (deux appuis sur Échap), le mode Plan pour explorer sans exécuter, les modes de permission graduables, et Auto Mode, actuellement en aperçu recherche, qui utilise un classifieur Sonnet 4.6 distinct pour évaluer chaque action avant de l'autoriser ou de l'escalader. Pour les équipes techniques, cette architecture en couches change concrètement la manière de travailler sur des projets à long terme. Les sous-agents isolent les tâches verbeuses pour préserver la clarté du contexte principal, tandis que l'Agent SDK expose la même boucle de manière programmatique via query(), permettant d'intégrer /code-review ou d'autres commandes dans des scripts. Le mode headless (claude -p "requête") et l'entrée par pipe (cat logs.txt | claude -p) ouvrent la voie à l'intégration dans des pipelines CI, des jobs planifiés et des hooks pre-commit via GitHub Actions, sans terminal interactif. Ce guide s'inscrit dans une montée en puissance rapide de Claude Code depuis ses débuts expérimentaux. Anthropic a progressivement empilé des couches de contrôle, permissions granulaires, sandboxing, compaction de contexte pour les longues sessions, pour rendre possibles des workflows autonomes sans sacrifier les garde-fous. La concurrence s'est densifiée dans ce segment : GitHub Copilot Agent, Cursor et d'autres environnements agentiques se disputent les workflows des développeurs. Dans ce contexte, Claude Code mise sur la compositionnalité comme avantage différenciant, c'est-à-dire la capacité d'assembler des primitives simples (skills, hooks, MCP, plugins) en systèmes d'ingénierie largement automatisés, adaptés aux équipes qui veulent dépasser l'autocomplétion pour atteindre une véritable délégation de tâches.

OutilsOutil
1 source
Atelier FineWeb : streaming, filtrage, déduplication, tokenisation et analyse de corpus web à grande échelle
2263MarkTechPost 

Atelier FineWeb : streaming, filtrage, déduplication, tokenisation et analyse de corpus web à grande échelle

FineWeb, le gigantesque corpus de données web publié par Hugging Face, fait l'objet d'un tutoriel technique approfondi qui guide les praticiens à travers un pipeline complet de traitement de données à grande échelle. Le jeu de données existe en plusieurs versions, dont un échantillon de 10 milliards de tokens (sample-10BT) suffisant pour l'expérimentation, et une version complète de plusieurs téraoctets inaccessible à la majorité des machines. Le tutoriel démontre comment charger 3 000 documents en streaming via la bibliothèque datasets de Hugging Face sans jamais télécharger le corpus intégral, puis inspecter les champs clés de chaque document : URL d'origine, langue détectée, score de confiance linguistique et nombre de tokens. Chaque enregistrement expose ainsi une traçabilité complète permettant d'analyser la provenance et la qualité du contenu web brut. Ce type de travail pratique revêt une importance capitale pour quiconque cherche à comprendre comment les grands modèles de langage sont réellement entraînés. FineWeb constitue l'une des bases d'entraînement open source les plus documentées disponibles aujourd'hui, et en reproduire les mécanismes de filtrage permet aux équipes de recherche et aux entreprises d'appliquer les mêmes standards de qualité à leurs propres corpus. Le tutoriel implémente trois familles de filtres complémentaires : les heuristiques Gopher (longueur des mots, densité de symboles, présence de mots fonctionnels), les règles C4 (détection de gabarits vides, de JavaScript désactivé, de blocs CSS), et des filtres FineWeb personnalisés ciblant la redondance de lignes et les structures de type liste. La déduplication par MinHash permet ensuite d'éliminer les quasi-doublons inter-documents, un problème critique qui biaise l'apprentissage si laissé non traité. La vérification des comptes de tokens avec le tokenizer GPT-2 via la bibliothèque tiktoken clôture le pipeline de validation. FineWeb s'inscrit dans un mouvement plus large de démocratisation des corpus d'entraînement de haute qualité, initié notamment par les travaux de Hugging Face sur The Stack et ROOTS. Avant FineWeb, reproduire les pipelines de filtrage utilisés par les laboratoires comme OpenAI ou DeepMind relevait du secret industriel ; publier non seulement les données mais aussi les métadonnées de traitement change la donne pour la recherche académique et les acteurs indépendants. Les enjeux sont doubles : d'un côté la capacité à entraîner des modèles performants sans dépendre de données propriétaires, de l'autre la question de la provenance et de la conformité légale du contenu web à grande échelle, particulièrement sensible depuis les procès intentés contre OpenAI et Meta pour utilisation non autorisée de données protégées par le droit d'auteur.

RechercheTuto
1 source
Google Cloud lance un format ouvert pour convertir des documents épars en fichiers Markdown destinés aux agents IA
2264The Decoder 

Google Cloud lance un format ouvert pour convertir des documents épars en fichiers Markdown destinés aux agents IA

Google Cloud a lancé l'Open Knowledge Format (OKF), un nouveau standard destiné à transformer la documentation organisationnelle éparpillée en fichiers Markdown structurés avec frontmatter YAML. L'objectif : rendre la connaissance interne des entreprises portable et directement exploitable par des agents d'intelligence artificielle. La spécification, délibérément minimaliste, propose un cadre commun pour unifier des contenus aujourd'hui dispersés entre wikis, bases de données, outils SaaS et documents PDF. L'enjeu est considérable pour les entreprises qui déploient des agents IA en interne. Actuellement, ces agents peinent à accéder à la connaissance organisationnelle parce qu'elle ne respecte aucun format unifié. OKF résout ce problème structurel en imposant une couche de standardisation légère : chaque document devient un fichier texte lisible à la fois par un humain et par un LLM, avec des métadonnées explicites permettant aux agents de comprendre le contenu, sa portée et sa pertinence sans transformation préalable. La démarche de Google Cloud s'inscrit dans un mouvement intellectuel récent : Andrej Karpathy, chercheur emblématique passé par Tesla et OpenAI, avait popularisé ce concept sous l'appellation "LLM Wiki", plaidant pour des bases de connaissances conçues nativement pour les modèles de langage. En formalisant cette intuition sous forme de standard ouvert, Google Cloud cherche à s'imposer comme référence dans l'écosystème des agents d'entreprise, un marché en forte croissance où la qualité et l'accessibilité de la connaissance structurée sont devenues des avantages concurrentiels décisifs.

OutilsOpinion
1 source
KPMG a fabriqué de faux cas d'usage IA dans un rapport pour convaincre ses clients d'adopter l'IA
2265The Decoder 

KPMG a fabriqué de faux cas d'usage IA dans un rapport pour convaincre ses clients d'adopter l'IA

KPMG, l'un des quatre grands cabinets d'audit mondiaux, a publié un rapport destiné à convaincre ses clients d'adopter l'intelligence artificielle, mais plusieurs études de cas qu'il contenait étaient entièrement fabriquées. Le document citait notamment UBS, la banque d'investissement suisse, et le NHS, le système de santé public britannique, comme exemples de déploiements réussis d'IA en entreprise. C'est Edward Tian, PDG de GPTZero, spécialiste de la détection de textes générés par IA, qui a contribué à révéler ces falsifications. Depuis, KPMG a retiré le rapport de la circulation. L'affaire met en lumière un risque que Tian baptise "hallucinations secondaires" : des informations erronées produites par des cabinets de conseil réputés, qui se diffusent sans être questionnées grâce au prestige institutionnel de leur source. Contrairement aux erreurs d'un chatbot, facilement identifiables comme venant d'un outil IA, celles d'un rapport signé KPMG sont prises pour argent comptant par des dirigeants qui s'en servent pour justifier des investissements stratégiques, parfois chiffrés en millions d'euros. L'incident survient dans un contexte de course effrénée à l'adoption de l'IA, où les grands cabinets de conseil se disputent un rôle de guide stratégique auprès des directions d'entreprise. La pression commerciale et le recours croissant aux outils génératifs dans la production de contenus créent un terrain fertile pour ce type d'erreur, d'autant que les vérifications factuelles restent souvent insuffisantes. Cette affaire soulève une question de fond sur la responsabilité des intermédiaires qui profitent de l'engouement pour l'IA tout en alimentant ses dérives.

ÉthiqueOpinion
1 source
Les agents IA de codage trouvent le bon fichier mais passent à côté des lignes essentielles, selon une étude
2266The Decoder 

Les agents IA de codage trouvent le bon fichier mais passent à côté des lignes essentielles, selon une étude

Les agents de codage dopés à l'intelligence artificielle, comme Claude Code d'Anthropic ou Codex d'OpenAI, souffrent d'un angle mort précis : ils localisent correctement le fichier contenant un bug, mais ratent la majorité des lignes critiques à l'intérieur de ce fichier. C'est ce que révèle SWE-Explore, un nouveau benchmark conçu spécifiquement pour évaluer la phase d'exploration du code, c'est-à-dire la recherche et la navigation dans une base de code, séparément de la phase de correction proprement dite. C'est une première dans l'évaluation des outils de développement automatisé. Ce découplage entre exploration et réparation change la façon d'interpréter les performances des agents de codage. Jusqu'ici, les benchmarks dominants comme SWE-bench mesuraient uniquement le résultat final : le bug est-il corrigé ou non ? SWE-Explore montre qu'un agent peut échouer non pas parce qu'il ne sait pas corriger le code, mais parce qu'il n'a pas identifié les bonnes lignes à modifier. Sans contexte suffisant, même le meilleur algorithme de correction produit un patch inutile. Les développeurs qui s'appuient sur ces outils en production s'exposent donc à des corrections en apparence valides mais ciblant les mauvaises sections. Ce travail s'inscrit dans une dynamique de remise en question des métriques utilisées pour comparer les agents de développement. L'industrie investit massivement dans ces outils, GitHub Copilot, Cursor, Devin, et les entreprises les vendent sur des taux de résolution de tickets. SWE-Explore suggère que ces chiffres masquent une faiblesse structurelle en amont : la compréhension fine d'une base de code existante reste un problème ouvert, et le résoudre conditionne tout le reste.

RecherchePaper
1 source
Amazon et cinq autres entreprises auraient déclenché les mesures gouvernementales contre le modèle Fable d'Anthropic
2267The Decoder 

Amazon et cinq autres entreprises auraient déclenché les mesures gouvernementales contre le modèle Fable d'Anthropic

Amazon CEO Andy Jassy, accompagné de dirigeants d'au moins cinq autres grandes entreprises technologiques, a alerté l'administration Trump sur des failles de sécurité identifiées dans Fable, le nouveau grand modèle de langage d'Anthropic. En quelques heures à peine après ces signalements, la Maison-Blanche a ordonné le retrait du modèle via un arrêté de contrôle des exportations, contraignant Anthropic à le mettre hors ligne immédiatement. L'identité précise des autres entreprises ayant participé à ce signalement collectif n'a pas été officiellement divulguée. La décision révèle une tension inédite au sein du secteur : Amazon est l'un des principaux bailleurs de fonds d'Anthropic, y ayant investi plusieurs milliards de dollars, tout en ayant participé activement au déclenchement de cette mesure gouvernementale contre son propre partenaire. Pour les développeurs et entreprises qui intégraient Fable dans leurs applications, le retrait brutal du modèle constitue une interruption majeure. Au-delà, l'épisode confirme que Washington est désormais prêt à mobiliser les contrôles à l'exportation comme levier direct de régulation des modèles d'IA avancés. Cette affaire s'inscrit dans un contexte de surveillance croissante des laboratoires d'IA par les autorités américaines, notamment autour des risques liés à la prolifération de systèmes très puissants. La coïncidence entre les investissements massifs d'Amazon dans Anthropic et son rôle concurrent via ses propres modèles déployés sur AWS Bedrock nourrit des questions sur d'éventuels conflits d'intérêts. Certains analystes y voient autant une démonstration de force politique qu'une décision de sécurité légitime, et l'avenir du modèle Fable reste à ce stade incertain.

Databricks publie Omnigent en open source : un orchestrateur d'agents IA qui unifie Claude Code, Codex et Pi
2268MarkTechPost 

Databricks publie Omnigent en open source : un orchestrateur d'agents IA qui unifie Claude Code, Codex et Pi

Databricks a publié Omnigent, un "meta-harness" open source placé au-dessus des agents IA existants comme Claude Code, Codex et Pi. Développé en collaboration avec Neon et distribué sous licence Apache 2.0, Omnigent ne remplace pas ces outils : il s'installe une couche au-dessus d'eux pour les orchestrer comme des pièces interchangeables d'un même système. Concrètement, un "harness" est l'enveloppe logicielle qui transforme un modèle de langage en agent capable d'agir. Omnigent standardise l'interface de ces harnesses, messages entrants, fichiers, flux de texte et appels d'outils sortants, pour qu'ils deviennent substituables sans réécriture de code. L'outil s'installe via deux alias CLI identiques, omnigent et omni, et lance au démarrage une interface web locale sur localhost:6767, synchronisée en temps réel avec le terminal et accessible depuis un téléphone. Pour les équipes d'ingénieurs qui jonglent déjà entre quatre ou cinq agents simultanément en copiant du texte entre des outils de code, des moteurs de recherche et Slack, Omnigent apporte trois capacités structurantes. La composition permet de combiner modèles et harnesses sans toucher au code : un simple changement d'une ligne suffit à basculer de Claude Code à Codex. Le contrôle introduit des politiques stateful, par exemple, mettre un agent en pause après chaque dépense de 100 dollars, ou exiger une validation humaine avant un git push si l'agent a installé un nouveau paquet npm. La collaboration permet de partager une session d'agent en direct par URL : les coéquipiers peuvent observer, commenter des fichiers, co-piloter ou bifurquer la conversation. Un sandbox système appelé Omnibox assure la sécurité sous-jacente, notamment en injectant les tokens GitHub uniquement via un proxy de sortie approuvé, sans les exposer à l'agent. Le projet embarque deux agents d'exemple révélateurs de la philosophie de l'outil. "Polly" est un orchestrateur multi-agents qui ne génère aucun code lui-même : il planifie, puis délègue en parallèle à des sous-agents dans des worktrees git distincts, avec une revue croisée assurée par un agent d'un fournisseur différent de celui qui a écrit le code. "Debby" est un partenaire de brainstorming à deux têtes, Claude et GPT, qui répond en parallèle à chaque question et peut déclencher un débat contradictoire entre les deux via la commande /debate. Ces exemples illustrent une tendance de fond : avec la multiplication des agents spécialisés, la compétition ne se joue plus seulement au niveau du modèle, mais à celui de l'orchestration. Omnigent positionne Databricks sur ce terrain en proposant une couche de gouvernance neutre, ouverte, et potentiellement universelle pour l'écosystème des agents de développement.

OutilsOutil
1 source
MCP a résolu l'appel d'outils, A2A la coordination. Et le transport ?
2269VentureBeat AI 

MCP a résolu l'appel d'outils, A2A la coordination. Et le transport ?

En l'espace de dix-huit mois, l'écosystème des agents IA a produit quatre protocoles de communication majeurs qui redessinent en profondeur la façon dont les systèmes d'intelligence artificielle interagissent. Anthropic a lancé le Model Context Protocol (MCP) fin 2024, IBM Research a publié l'Agent Communication Protocol (ACP) en mars 2025, Google a dévoilé Agent2Agent (A2A) en avril 2025, et un groupe de travail indépendant a proposé l'Agent Network Protocol (ANP). En avril 2026, MCP comptait déjà plus de 10 000 serveurs publics actifs et 164 millions de téléchargements mensuels du SDK Python, confirmant sa domination sur la couche d'appel d'outils. Google a cédé A2A à la Linux Foundation en juin 2025. Parallèlement, le W3C a ouvert un groupe communautaire dédié aux protocoles d'agents IA, et l'IETF reçoit des propositions de standards pour le transport entre agents. Ce qui semblait chaotique révèle en réalité une logique de pile : chaque protocole adresse une couche distincte. MCP est un contrat RPC typé entre un client-modèle et un serveur d'outils, il gère la découverte de fonctions et leur invocation via HTTP. A2A comble ce que MCP laisse ouvert : la coordination de tâches entre agents, avec des "Agent Cards" pour déclarer les capacités, des états de cycle de vie et trois modes d'interaction (synchrone, streaming, asynchrone). ACP, lui, est une enveloppe de message légère et sans état, utile quand la sémantique complète d'A2A serait excessive. ANP apporte identité décentralisée via des DID et descriptions de capacités en JSON-LD, posant les bases de marketplaces d'agents sans registre central. Ces couches se complètent, elles ne se concurrencent pas. La question non résolue est celle du transport. Tous ces protocoles tournent sur HTTP, un choix qui reflète l'origine de leurs concepteurs : équipes de recherche, fournisseurs d'API, éditeurs enterprise pour qui HTTP est une évidence. Mais HTTP a été conçu pour des échanges requête-réponse entre humains et serveurs, pas pour des flux de tâches longue durée entre agents autonomes. L'histoire des protocoles distribués montre un schéma invariable : prolifération d'abord, consolidation ensuite. CORBA, DCOM, RMI et SOAP se sont battus pour l'intégration enterprise dans les années 1990 avant que REST ne gagne en étant plus simple et natif HTTP. XMPP, IRC et des dizaines de protocoles propriétaires ont fragmenté la messagerie temps réel avant que MQTT et WebSockets ne s'imposent dans leurs niches respectives. L'écosystème IA est aujourd'hui en phase de prolifération. La convergence viendra lorsque l'interopérabilité deviendra une nécessité économique, mais les décisions d'architecture prises maintenant définiront quels protocoles survivront à cette consolidation.

InfrastructureOpinion
1 source
Nano Banana vs Artspace AI : quelle IA pour créer des images époustouflantes ?
2270Le Big Data 

Nano Banana vs Artspace AI : quelle IA pour créer des images époustouflantes ?

Nano Banana et Artspace AI s'imposent comme deux plateformes de génération d'images par intelligence artificielle qui redéfinissent les standards de la création visuelle numérique. Nano Banana est développé par Google, dont les serveurs californiens de Mountain View alimentent le moteur de calcul. L'outil prend en charge la génération d'images et de vidéos haute définition, intègre un module d'édition avancé pour retoucher photos et fichiers vidéo, et s'appuie sur les algorithmes de la firme pour interpréter des requêtes textuelles complexes grâce à une analyse sémantique fine. Artspace AI se positionne quant à lui comme un studio de création dématérialisé : il exploite des modèles comme Flux Nova, propose plus de 200 outils de modification intégrés, et se distingue par des fonctions d'inpainting pour restaurer des clichés anciens ou transformer une photo ordinaire en aquarelle via un simple curseur de similarité. L'enjeu pour les professionnels et créatifs est considérable, car le choix entre ces deux plateformes détermine directement la nature et la qualité des productions graphiques. Nano Banana excelle dans la génération de masse à vitesse élevée, avec des textures de peau et des reflets lumineux d'une netteté quasi photographique dès le premier rendu, un avantage décisif pour les agences ou les équipes marketing qui ont besoin de volumes importants. Artspace AI répond à un besoin différent : sa polyvalence extrême permet d'explorer des registres aussi variés que le croquis au fusain, la peinture à l'huile ou la restauration patrimoniale, ce qui en fait un choix privilégié pour les illustrateurs, artistes et photographes qui travaillent sur des visuels existants avec une précision chirurgicale. Cette confrontation s'inscrit dans un marché de la génération d'images IA en pleine ébullition, où des acteurs comme Midjourney ont démontré que l'accessibilité via une interface web pouvait suffire à capter des millions d'utilisateurs. Google, avec Nano Banana, mise sur son infrastructure cloud et son intégration à l'écosystème existant pour concurrencer des solutions indépendantes. Artspace AI, en se spécialisant dans la retouche progressive et le contrôle granulaire des modifications, cible un segment plus technique et moins occupé par les géants. La bataille n'est pas tant celle du meilleur générateur universel que celle de la pertinence selon l'usage : vitesse et réalisme d'un côté, flexibilité artistique et contrôle de l'autre. Les suites dépendront de la capacité de chaque plateforme à intégrer de nouveaux modèles et à fidéliser leurs communautés respectives dans un secteur où les cycles d'innovation se comptent en semaines.

CréationOutil
1 source
Créer un espace de travail d'agents QwenPaw : compétences personnalisées, fournisseurs de modèles et API en streaming
2271MarkTechPost 

Créer un espace de travail d'agents QwenPaw : compétences personnalisées, fournisseurs de modèles et API en streaming

Un tutoriel détaillé publié récemment présente QwenPaw, un environnement de travail destiné aux développeurs souhaitant construire et tester des assistants pilotés par des agents IA. Le guide explique pas à pas comment installer et initialiser QwenPaw dans un environnement Google Colab, configurer un répertoire de travail structuré, activer l'authentification sécurisée avec génération automatique d'un mot de passe aléatoire, et connecter des fournisseurs de modèles externes via les secrets Colab. L'architecture repose sur une organisation en répertoires distincts, espace de travail, secrets, journaux, et expose le service sur un port configurable (par défaut le 8088), avec la possibilité de rendre la console accessible publiquement via un tunnel Cloudflare. Ce type d'environnement répond à un besoin concret des équipes de développement IA : disposer d'un espace intégré pour concevoir des agents, tester leurs compétences personnalisées (« skills »), et valider le comportement de l'API de chat en streaming, le tout sans sortir de l'environnement de développement. En permettant de connecter différents fournisseurs de modèles à la volée et d'exposer une interface console accessible via URL, QwenPaw réduit la friction entre la phase de prototypage et celle de mise en production. La prise en charge native du streaming d'API et d'un garde-fou sur les outils (QWENPAWTOOLGUARD_ENABLED) montre une attention particulière à la robustesse en environnement multi-agents, où les appels d'outils mal contrôlés peuvent rapidement devenir une source d'erreurs coûteuses. QwenPaw s'inscrit dans l'écosystème grandissant des frameworks d'agents IA, qui cherchent à standardiser la façon dont les modèles de langage interagissent avec des outils, des bases de connaissances locales et des API externes. Son nom évoque une parenté avec les modèles Qwen, la famille de LLM développée par Alibaba/Tongyi, très utilisée dans les contextes où l'on cherche des alternatives aux modèles d'OpenAI ou Anthropic. Le fait que le tutoriel soit conçu pour fonctionner directement dans Google Colab, environnement d'exécution gratuit et largement adopté, suggère une volonté de rendre ce framework accessible à un public plus large, au-delà des équipes disposant d'infrastructure dédiée. La direction prise, avec des fonctionnalités comme le scan de compétences en mode « warn » et la gestion fine des permissions, laisse anticiper une montée en maturité vers des cas d'usage de production.

OutilsTuto
1 source
Un nouveau modèle d'IA baptisé "Count Anything" compte tout ce qu'on lui montre, et c'est plus difficile qu'il n'y paraît
2272The Decoder 

Un nouveau modèle d'IA baptisé "Count Anything" compte tout ce qu'on lui montre, et c'est plus difficile qu'il n'y paraît

Un nouveau modèle d'intelligence artificielle baptisé « Count Anything » vient d'être présenté comme le premier système capable de dénombrer des objets dans n'importe quel type d'image, qu'il s'agisse de foules humaines, de cellules observées au microscope ou de tout autre sujet visuel. Son fonctionnement repose sur une simple invite textuelle : l'utilisateur décrit ce qu'il souhaite compter, et le modèle s'exécute. Lors de tests comparatifs, Count Anything divise par deux le taux d'erreur par rapport aux systèmes précédents, ce qui représente un bond significatif en termes de précision. Les applications potentielles couvrent des secteurs très différents. En médecine, compter automatiquement des cellules ou des bactéries sur des échantillons accélère le diagnostic et réduit la charge des techniciens de laboratoire. En gestion des foules, les organisateurs d'événements ou les forces de l'ordre pourraient estimer des effectifs en temps réel à partir d'une simple photo. Tout domaine nécessitant un inventaire visuel rapide, de l'agriculture au contrôle qualité industriel en passant par l'écologie, pourrait bénéficier d'un tel outil universel. Le comptage d'objets en vision par ordinateur est un problème ancien et difficile : les approches traditionnelles nécessitaient des modèles entraînés spécifiquement pour chaque catégorie d'objets. L'ambition de Count Anything est de briser cette fragmentation avec un modèle généraliste piloté par le langage naturel, dans la lignée des grands modèles multimodaux comme GPT-4V ou Gemini. Des limites subsistent néanmoins : le modèle peine encore face à des scènes très denses ou lorsque les termes de la requête restent ambigus, deux points que de futures versions devront améliorer.

RecherchePaper
1 source
Jassy (Amazon) a exprimé des inquiétudes sur le modèle d'Anthropic avant les restrictions de Trump
2273The Information AI 

Jassy (Amazon) a exprimé des inquiétudes sur le modèle d'Anthropic avant les restrictions de Trump

Andy Jassy, PDG d'Amazon, a contacté de hauts responsables de l'administration Trump cette semaine pour signaler des risques de sécurité liés aux modèles les plus avancés d'Anthropic. Ces échanges, tenus dans les derniers jours, ont directement contribué à déclencher, vendredi soir, de nouvelles restrictions à l'exportation visant deux modèles d'Anthropic : Claude Mythos 5 et Fable 5. Ces mesures, justifiées par des préoccupations de sécurité nationale, suspendent l'accès à ces modèles pour les ressortissants étrangers. Pour se conformer aux nouvelles règles, Anthropic a choisi de couper l'accès à l'ensemble de ses clients, sans distinction de nationalité. La démarche d'Andy Jassy est particulièrement notable : Amazon est à la fois l'un des plus grands investisseurs d'Anthropic et l'un de ses principaux partenaires commerciaux, notamment via AWS. Qu'un allié stratégique soulève lui-même des alertes de sécurité auprès du gouvernement témoigne de la sensibilité exceptionnelle des capacités de ces modèles de dernière génération. L'impact commercial est immédiat pour Anthropic, qui se trouve contrainte de bloquer un accès mondial à ses produits phares pour respecter le cadre réglementaire. Cet épisode s'inscrit dans une tension croissante entre l'essor des modèles d'IA frontier et les impératifs de contrôle technologique des États-Unis face à des puissances concurrentes, notamment la Chine. Washington cherche depuis plusieurs années à encadrer l'exportation des technologies d'IA les plus performantes. Cette décision marque une escalade inédite : pour la première fois, des modèles commerciaux grand public se retrouvent soumis à des restrictions comparables à celles appliquées aux logiciels militaires ou aux semi-conducteurs avancés.

RégulationReglementation
1 source
Mélenchon, Attal, Bardella, Retailleau : la coupure d’Anthropic les met tous d’accord
2274Frandroid 

Mélenchon, Attal, Bardella, Retailleau : la coupure d’Anthropic les met tous d’accord

Anthropic a brutalement restreint l'accès à ses modèles d'intelligence artificielle les plus avancés pour certains utilisateurs et entreprises en France, invoquant des directives émanant de Washington. Cette décision, qui prive des développeurs, chercheurs et organisations françaises d'outils sur lesquels ils s'appuient au quotidien, a provoqué une réaction politique immédiate et transpartisane. Jean-Luc Mélenchon, Gabriel Attal, Jordan Bardella et Bruno Retailleau ont tous pris la parole pour dénoncer cette coupure, un alignement rarissime entre la gauche radicale, le camp macroniste, le Rassemblement National et la droite traditionnelle. Au-delà de l'anecdote politique, cet épisode révèle une vulnérabilité structurelle que peu voulaient admettre jusqu'ici : des pans entiers de l'économie numérique française dépendent d'infrastructures d'IA américaines, soumises au bon vouloir de Washington. La décision d'Anthropic démontre concrètement qu'une entreprise privée étrangère peut, du jour au lendemain, interrompre des services critiques sans recours possible pour les utilisateurs européens. Pour les entreprises ayant intégré Claude dans leurs workflows, l'impact opérationnel est immédiat. Cet incident s'inscrit dans un contexte de tensions croissantes autour du contrôle américain sur les technologies d'IA de pointe, renforcé par les nouvelles réglementations sur les exportations technologiques imposées sous l'administration Trump. La France et l'Union européenne débattent depuis des années de la nécessité d'une IA souveraine, mais les investissements concrets restent limités face aux géants américains. La coupure d'Anthropic risque d'accélérer les discussions autour de Mistral AI et des initiatives européennes, même si combler ce fossé technologique demandera plusieurs années et des milliards d'euros.

RégulationReglementation
1 source
Google Research : Gemini-SQL2 domine les benchmarks text-to-SQL avec une large avance
2275The Decoder 

Google Research : Gemini-SQL2 domine les benchmarks text-to-SQL avec une large avance

Google Research a publié Gemini-SQL2, un système capable de convertir du langage naturel en requêtes SQL exécutables, construit sur le modèle Gemini 3.1 Pro. Sur le benchmark BIRD, référence industrielle pour évaluer la conversion texte-vers-SQL, Gemini-SQL2 atteint un taux de précision de 80,04 %, distançant significativement les solutions concurrentes d'OpenAI et d'Anthropic. Cette performance place Google en tête d'un domaine à fort enjeu commercial : la capacité à interroger des bases de données en langage courant, sans écrire une seule ligne de code, ouvre l'accès à la donnée à des profils non techniques au sein des entreprises. Pour Google, l'intégration de cette technologie dans ses services de données comme BigQuery ou Looker pourrait accélérer l'adoption par des équipes analytiques qui dépendent aujourd'hui d'ingénieurs pour formuler leurs requêtes. Le benchmark BIRD, qui évalue la robustesse des modèles sur des bases de données réelles et complexes, est devenu le baromètre de référence depuis 2023 pour comparer les approches text-to-SQL. La course à ce type de capacité s'inscrit dans une compétition plus large entre les grands laboratoires pour intégrer l'intelligence artificielle directement dans les flux de travail d'entreprise. Avec Gemini-SQL2, Google consolide sa position sur le segment des outils de productivité données, un marché où Microsoft, via Copilot for Azure, et les startups spécialisées comme Text2SQL.ai exercent également une pression croissante.

LLMsActu
1 source
Anthropic restreint l'accès à Claude Fable 5 et Mythos 5 sur ordre américain : guide pour les entreprises
2276VentureBeat AI 

Anthropic restreint l'accès à Claude Fable 5 et Mythos 5 sur ordre américain : guide pour les entreprises

Le gouvernement américain a ordonné dans la nuit du 12 au 13 juin 2026 à Anthropic de suspendre immédiatement l'accès à ses deux modèles phares, Claude Fable 5 et Claude Mythos 5, en invoquant des autorités de sécurité nationale non précisées. En réponse, Anthropic a coupé tout accès public à ces modèles à l'échelle mondiale, frappant indistinctement les clients entreprises sous contrat, les utilisateurs grand public et même les employés d'Anthropic en interne. Les sessions en cours se terminent désormais en erreur, et les nouvelles requêtes sont automatiquement reroutées vers des modèles plus anciens comme Claude Opus 4.8. La mesure intervient seulement trois jours après le lancement public de Fable 5 et Mythos 5. Dans un billet de blog, Anthropic présente ses excuses à ses clients et déclare : "Nous pensons qu'il s'agit d'un malentendu et travaillons à rétablir l'accès dans les meilleurs délais." La société conteste par ailleurs la base factuelle de l'ordre, indiquant que le gouvernement ne lui a fourni à ce stade qu'une "preuve verbale d'un jailbreak potentiel, étroit et non universel", consistant essentiellement à demander au modèle de lire un codebase et d'en corriger les failles. Cette décision constitue un signal d'alarme majeur pour l'ensemble du secteur. L'élément déclencheur présumé est un jailbreak spectaculaire publié le 10 juin sur X par le chercheur en sécurité connu sous le pseudonyme "Pliny the Liberator", qui affirme avoir contourné les garde-fous de Fable 5 pour en extraire des instructions fonctionnelles liées à des cyberattaques, à la fabrication d'explosifs et à des voies de synthèse chimique, notamment la méthode de réduction de Birch pour la méthamphétamine. La technique décrite est sophistiquée : une attaque multi-agents exploitant Unicode, des homoglyphes, le cyrillique et un découpage des requêtes nuisibles en fragments anodins, réassemblés ensuite par un modèle Opus préalablement compromis. Anthropic argue toutefois que ces capacités sont "largement disponibles" dans d'autres modèles publics, citant nommément GPT-5.5 d'OpenAI, et avertit que suspendre un modèle commercial pour un jailbreak non universel pourrait "stopper de facto tout nouveau déploiement de modèles frontier pour l'ensemble des acteurs du secteur." Cet épisode s'inscrit dans une tendance préoccupante pour les entreprises utilisatrices d'IA cloud. Plus tôt en 2026, le Pentagone avait déjà mis Anthropic sur liste noire, révélant la fragilité structurelle d'une dépendance à un fournisseur unique. Les organisations qui font reposer des processus critiques sur l'API Claude se trouvent aujourd'hui privées de leurs outils sans préavis ni recours immédiat. Même si Opus 4.8 reste disponible, l'incident illustre concrètement pourquoi la redondance entre fournisseurs d'IA n'est plus une option mais une nécessité opérationnelle. L'issue dépend désormais des discussions entre Anthropic et les autorités fédérales américaines, dont le calendrier et le résultat restent entièrement incertains.

RégulationReglementation
1 source
SkillOpt de Microsoft améliore GPT-5.5 avec un simple fichier Markdown entraîné
2277The Decoder 

SkillOpt de Microsoft améliore GPT-5.5 avec un simple fichier Markdown entraîné

Microsoft, en collaboration avec trois universités chinoises, a mis au point SkillOpt, une méthode d'optimisation des documents d'instructions pour agents IA. Le principe est aussi simple qu'inattendu : un fichier Markdown soigneusement entraîné suffit à améliorer les performances de GPT-5.5 d'environ 23 points sur des tâches procédurales. La technique emprunte ses fondements aux méthodes d'entraînement classiques des grands modèles de langage, mais les applique non pas aux poids du réseau, mais au texte des instructions elles-mêmes. L'impact potentiel est considérable pour les développeurs et les entreprises qui déploient des agents IA. Le fichier Markdown optimisé ne se limite pas à GPT-5.5 : il se transfère à d'autres environnements comme Codex et Claude Code sans nécessiter de réentraînement supplémentaire. Cela signifie qu'il est possible d'améliorer substantiellement les capacités d'un agent en modifiant uniquement ses instructions textuelles, sans toucher aux modèles sous-jacents ni engager les coûts élevés d'un fine-tuning. Cette recherche reflète une dynamique croissante dans le domaine : optimiser les agents IA au niveau de leurs instructions plutôt qu'au niveau des paramètres du modèle. À mesure que les agents prolifèrent dans les environnements de développement logiciel et d'automatisation, la question de leur pilotage efficace devient centrale. SkillOpt propose une réponse légère et portable, qui pourrait redéfinir la manière dont les équipes techniques configurent et affinent leurs systèmes d'agents, quelle que soit la plateforme utilisée.

RecherchePaper
1 source
Le modèle open source Kimi K2.7 Code est jusqu'à 12 fois moins cher par token que GPT-5.5 et Claude
2278The Decoder 

Le modèle open source Kimi K2.7 Code est jusqu'à 12 fois moins cher par token que GPT-5.5 et Claude

Moonshot AI, la startup chinoise spécialisée en intelligence artificielle, a lancé Kimi K2.7 Code, un modèle open-weights d'un trillion de paramètres entièrement orienté vers la programmation. Disponible en accès public, ce modèle se distingue avant tout par son positionnement tarifaire agressif : son coût par token est jusqu'à douze fois inférieur à celui de GPT-5.5 d'OpenAI et de Claude Opus 4.8 d'Anthropic, les deux références actuelles du marché sur les tâches de code. Sur les benchmarks de programmation, Kimi K2.7 Code reste en retrait par rapport à GPT-5.5 et Claude Opus 4.8, sans atteindre leurs niveaux de précision. Mais la vraie question n'est pas celle de la performance brute : à budget équivalent, un développeur ou une entreprise peut effectuer douze fois plus d'appels avec Kimi K2.7 Code qu'avec ses concurrents propriétaires. Pour des cas d'usage à fort volume, comme l'autocomplétion en continu, la revue de code automatisée ou les agents de développement, ce différentiel de coût peut largement compenser l'écart de qualité. Ce lancement s'inscrit dans une tendance de fond où les modèles open-weights chinois rivalisent de plus en plus frontalement avec les grands modèles propriétaires américains sur le rapport qualité-prix. Moonshot AI suit une trajectoire similaire à celle de DeepSeek, qui avait bouleversé le secteur début 2025 avec des modèles très compétitifs à faible coût. La montée en puissance de ces alternatives accessibles force OpenAI et Anthropic à justifier leurs prix premium, et accélère la démocratisation des outils d'IA pour les équipes techniques aux ressources limitées.

LLMsOpinion
1 source
Anthropic désactive Claude Fable 5 et Mythos 5 sur ordre du gouvernement américain
2279MarkTechPost 

Anthropic désactive Claude Fable 5 et Mythos 5 sur ordre du gouvernement américain

Anthropic a désactivé ses deux modèles les plus puissants, Claude Fable 5 et Claude Mythos 5, pour l'ensemble de ses utilisateurs le 12 juin 2026, soit seulement trois jours après leur lancement le 9 juin. La décision fait suite à une directive de contrôle des exportations du gouvernement américain, transmise par le secrétaire au Commerce Howard Lutnick directement au PDG Dario Amodei. L'ordre cite des motifs de sécurité nationale et suspend l'accès à ces modèles pour tout ressortissant étranger, qu'il se trouve aux États-Unis ou à l'international, y compris les propres employés étrangers d'Anthropic. Incapable de distinguer en temps réel les ressortissants étrangers des utilisateurs américains, l'entreprise a choisi de couper l'accès à tous plutôt que de risquer une violation. Les autres modèles d'Anthropic, dont Claude Opus 4.8, restent pleinement accessibles. La tarification des deux modèles désactivés était fixée à 10 dollars par million de tokens en entrée et 50 dollars par million en sortie. L'arrêt simultané de deux modèles de pointe constitue un précédent industriel sans équivalent dans l'histoire de l'IA commerciale. Pour les milliers d'entreprises et développeurs ayant intégré Fable 5, un basculement automatique vers Opus 4.8 est opérationnel, mais la coupure perturbe les cas d'usage avancés qui dépendaient des capacités supplémentaires du niveau Mythos. Plus révélateur encore, l'ordre frappe également les partenaires du programme Glasswing, un cercle restreint d'organisations de confiance bénéficiant d'un accès anticipé à Mythos 5 et à Claude Mythos Preview. Anthropic avertit que si un simple contournement partiel suffit à justifier un tel rappel, aucune nouvelle génération de modèles ne pourrait être déployée sans risquer la même sanction, ce qui menacerait structurellement le rythme d'innovation de l'ensemble du secteur. La décision gouvernementale a été précipitée par une entreprise tierce affirmant avoir contourné les protections de Mythos 5, alarmant les autorités quant à d'éventuels risques pour la sécurité nationale. L'administration avait d'abord tenté de retarder le lancement des modèles ; Anthropic avait refusé, et la lettre de contrôle des exportations a suivi. L'entreprise conteste la logique du gouvernement tout en s'y conformant : elle soutient que la vulnérabilité identifiée est étroite, non universelle, et présente sur d'autres modèles publics comme GPT-5.5 d'OpenAI. Anthropic rappelle avoir soumis Fable 5 à des milliers d'heures de tests adversariaux avant son lancement, avec la participation du gouvernement américain, du UK AISI et d'organisations externes, sans qu'aucun contournement universel n'ait été découvert. La firme qualifie la situation de probable malentendu et entend travailler avec les autorités pour rétablir l'accès dans les meilleurs délais.

Le gouvernement américain contraint Anthropic à désactiver Claude Fable 5 et Mythos 5 dans le monde entier
2280The Decoder 

Le gouvernement américain contraint Anthropic à désactiver Claude Fable 5 et Mythos 5 dans le monde entier

Le gouvernement américain a ordonné à Anthropic de désactiver l'accès mondial à deux de ses modèles phares, Fable 5 et Mythos 5, invoquant des risques de contournement des garde-fous de sécurité, communément appelés « jailbreaks ». La mesure s'applique à l'ensemble des clients dans le monde, quelle que soit leur localisation. Anthropic se dit en conformité avec l'injonction, mais conteste publiquement les fondements de la décision. La startup californienne affirme que les vulnérabilités identifiées sont mineures et présentes de la même façon dans les modèles concurrents, citant notamment GPT-5.5 d'OpenAI. La décision crée un précédent potentiellement dévastateur pour l'ensemble de l'industrie : si ce type d'intervention gouvernementale se normalise, tout déploiement de modèle frontier pourrait être suspendu sur injonction fédérale, indépendamment de sa maturité ou de ses mesures de sécurité intégrées. Les clients professionnels et développeurs qui dépendent de ces modèles se retrouvent coupés sans préavis. La situation comporte une ironie notable : Anthropic a passé plusieurs mois à communiquer intensément sur les risques cybersécurité spécifiques à sa gamme Mythos, une stratégie de positionnement qui aura finalement fourni au régulateur les arguments pour justifier cette mise hors ligne forcée. L'affaire illustre la tension croissante entre l'administration américaine et les laboratoires d'IA de pointe, dans un contexte où Washington cherche à encadrer la diffusion des modèles les plus puissants avant que la concurrence internationale, notamment chinoise, ne dicte ses propres normes.

RégulationReglementation
1 source