Aller au contenu principal

Dossier OpenAI — page 40

2163 articles · page 40 sur 44

Toute l'actualité d'OpenAI : nouvelles versions de ChatGPT et GPT, stratégie produit, partenariats, controverses et décisions de Sam Altman.

Alibaba dévoile Qwen-Image-3.0, capable de générer grilles d'infographies complètes et texte lisible dès dix pixels en une seule passe
1951The Decoder CréationActu

Alibaba dévoile Qwen-Image-3.0, capable de générer grilles d'infographies complètes et texte lisible dès dix pixels en une seule passe

Alibaba a présenté Qwen-Image-3.0, un nouveau générateur d'images développé par son équipe Qwen, capable d'accepter des instructions textuelles allant jusqu'à 4 500 tokens. Le modèle sait produire du texte lisible dans l'image jusqu'à une taille de dix pixels seulement, et prend en charge nativement douze langues. Il peut générer en une seule passe des compositions complexes comme des infographies détaillées, des documents mis en page façon LaTeX ou encore des reproductions de pages de journaux, avec une grille d'éléments cohérente et du texte intégré fidèle à la demande initiale. Cette avancée marque une étape dans la capacité des générateurs d'images à gérer du texte long et structuré, un point faible traditionnel de ces modèles qui produisaient souvent des caractères déformés ou illisibles au-delà de quelques mots. Pour les professionnels du design, du marketing ou de l'édition, la possibilité de générer directement des mises en page complexes avec du texte net pourrait accélérer certains prototypages visuels. Toutefois, l'utilité pratique reste limitée par un obstacle de taille: le résultat final est une image pixelisée, non un fichier éditable, ce qui empêche toute modification fine du texte ou de la mise en page une fois l'image produite, contrairement à des outils de conception vectorielle ou de traitement de texte classiques. Cette sortie s'inscrit dans la compétition intense que se livrent les laboratoires chinois et occidentaux sur la génération d'images par IA, où Alibaba cherche à consolider la position de sa famille de modèles Qwen face à des concurrents comme Midjourney, Stable Diffusion ou les outils d'OpenAI et de Google. La gestion de texte long et multilingue, ainsi que la composition de documents structurés, représentent un axe de différenciation stratégique alors que ces modèles visent des usages professionnels au-delà de la simple illustration. Reste à voir si Alibaba proposera à terme des formats de sortie éditables, ce qui déterminera l'adoption réelle de cette technologie dans des flux de travail créatifs concrets.

1 source
Bonne nouvelle pour les parents ! Meta AI pourra bientôt les alerter si leur ado est en danger
1952Le Big Data 

Bonne nouvelle pour les parents ! Meta AI pourra bientôt les alerter si leur ado est en danger

Meta a annoncé le 16 juillet 2026 une nouvelle fonctionnalité baptisée « Parent Alerts », qui permettra d'alerter les parents lorsqu'un adolescent échange avec Meta AI des propos évoquant des idées suicidaires ou un risque d'automutilation. L'entreprise a développé un système d'intelligence artificielle dédié pour repérer ce type de conversations à risque. Concrètement, si l'IA détecte un signal préoccupant, la conversation signalée est ensuite examinée par une équipe humaine avant qu'une notification ne soit envoyée aux parents, accompagnée de ressources et de recommandations pour réagir de façon adaptée. Le déploiement débute aux Etats-Unis, au Royaume-Uni, au Canada et en Australie, réservé pour l'instant aux familles utilisant le contrôle parental d'Instagram, avant une extension mondiale prévue d'ici la fin de l'année 2026. Cette fonctionnalité répond à un constat difficile à ignorer pour les parents : les adolescents se confient de plus en plus à des agents conversationnels lors de moments de détresse, parfois autant qu'à leurs proches ou à un journal intime. Meta cherche donc à transformer cet usage en filet de sécurité plutôt qu'en angle mort. L'entreprise assume une logique de prudence maximale : même quand l'examinateur humain juge les intentions de l'adolescent ambiguës, une alerte peut tout de même être envoyée aux parents, au nom du principe qu'il vaut mieux prévenir à tort que laisser passer une situation réellement dangereuse. Ce choix illustre l'équilibre délicat que Meta tente de trouver entre protection des mineurs et respect de leur vie privée, un sujet qui suscite régulièrement des débats autour des outils de contrôle parental. Cette annonce s'inscrit dans un mouvement plus large de l'industrie vers une IA conversationnelle dotée de garde-fous de sécurité mentale. Meta travaille déjà sur une extension encore plus sensible : une fonctionnalité capable de contacter directement les services d'urgence si une conversation avec Meta AI laisse penser qu'un utilisateur, mineur ou adulte, est en danger imminent, bien qu'aucune date de lancement n'ait été communiquée. Cette initiative fait écho à celle d'OpenAI, qui avait lancé en mai 2026 la fonction « Contact de confiance » sur ChatGPT, permettant à un utilisateur de désigner une personne à prévenir en cas de risque suicidaire détecté. En parallèle, Meta élargit aussi son option « Contenu limité » aux échanges avec son IA sur Instagram. Ces annonces successives montrent que les grands acteurs de l'IA générative considèrent désormais la détresse psychologique des utilisateurs, et particulièrement des adolescents, comme un enjeu de sécurité produit à part entière, et non plus comme un simple sujet périphérique.

SociétéActu
1 source
J'ai un pressentiment
1953Ben's Bites 

J'ai un pressentiment

Thinking Machines, la startup fondée par l'ancienne directrice technique d'OpenAI Mira Murati, a lancé Inkling, son premier modèle en poids ouverts (open-weights). Le modèle dispose d'une fenêtre de contexte d'un million de tokens et fonctionne sur trois modalités : texte, image et audio. Il reste toutefois loin derrière les meilleurs modèles ouverts du marché, dont la plupart proviennent aujourd'hui de laboratoires chinois, à l'image de GLM-5.2, considéré comme l'un des modèles open source les plus performants actuellement, même s'il ne gère pas encore les images en entrée. Inkling est disponible sur Tinker, la plateforme de fine-tuning de Thinking Machines, permettant aux développeurs de créer des versions personnalisées adaptées à des cas d'usage spécifiques. Par ailleurs, OpenAI a révélé l'existence de GPT-Red, un modèle interne conçu pour attaquer ses propres modèles afin de détecter les instructions cachées capables de les détourner ; cet outil a servi à renforcer la sécurité de GPT-5.6 Sol lors de son entraînement. Google a aussi mis à jour Gemini Spark, son concurrent d'OpenClaw, qui peut désormais éditer des documents Google Docs, lire les commentaires dans Sheets et Slides, et traiter plusieurs sources en parallèle, le tout 50% plus rapidement qu'auparavant. Ces annonces illustrent une bataille de plus en plus intense autour des modèles ouverts, un segment où de nombreuses startups délaissent progressivement les modèles propriétaires les plus puissants au profit de versions auto-hébergées ou affinées de modèles comme GLM-5.2, pour des raisons de coûts et de contrôle. Le fait qu'Inkling arrive loin derrière l'offre chinoise souligne à quel point les laboratoires occidentaux peinent à rivaliser sur ce terrain précis. Du côté de la sécurité, l'existence de GPT-Red témoigne d'une prise de conscience croissante des risques de manipulation par instructions cachées, un sujet d'autant plus sensible qu'un incident récent a montré qu'un prompt dissimulé avait réussi à faire fuiter par Claude des noms, employeurs et réponses à des questions de sécurité issus de sa mémoire. Ce climat de vigilance accrue rejoint les propos tenus par Demis Hassabis, directeur général de DeepMind, qui estime que l'intelligence artificielle générale (AGI) est probablement encore à quelques années. Il appelle à la création d'un organisme de normalisation dirigé par les États-Unis pour tester les modèles les plus avancés avant leur déploiement commercial, avec un partage volontaire des modèles jusqu'à 30 jours avant leur sortie pour évaluer les risques liés à la cybersécurité, aux menaces biologiques et aux comportements trompeurs. Cette proposition, pour l'instant sur une base volontaire mais avec la possibilité d'une approbation de déploiement obligatoire à terme, s'inscrit dans un contexte où même les outils grand public suscitent la controverse : xAI a dû rendre open source son assistant de code Grok Build après que des utilisateurs ont découvert que l'outil envoyait leur code vers ses serveurs par défaut.

💬 Le vrai signal, c'est pas Inkling, c'est son classement : il arrive loin derrière GLM-5.2, un modèle chinois. Une startup fondée par l'ex-CTO d'OpenAI qui sort son premier modèle ouvert et se fait doubler comme ça, ça en dit long sur qui mène vraiment la course à l'open source aujourd'hui. Le million de tokens de contexte et les trois modalités, c'est solide sur le papier, mais la hiérarchie du open-weights s'écrit clairement à Pékin, pas à San Francisco.

LLMsActu
1 source
5 tendances qui ont marqué l'AI Engineering au World's Fair 2026
1954Latent Space 

5 tendances qui ont marqué l'AI Engineering au World's Fair 2026

Le salon AI Engineer World's Fair 2026 a confirmé la maturation rapide de l'ingénierie IA, trois ans après que swyx (Shawn Wang) a inventé le terme "AI engineer" en juin 2023, à une époque où l'on parlait encore de "prompt engineering". L'édition 2026 s'est distinguée par cinq grandes tendances plutôt que par des annonces isolées. La première, et la plus marquante, est le glissement du focus des agents eux-mêmes vers les systèmes qui les entourent. Lilian Weng, ancienne chercheuse d'OpenAI et désormais cofondatrice de Thinking Machines Lab, illustre ce basculement entre son article de 2023, "LLM Powered Autonomous Agents" (qui citait AutoGPT, BabyAGI et GPT-Engineer comme exemples prometteurs), et son nouvel essai 2026, "Harness Engineering for Self-Improvement", centré sur le "harnais" gérant workflows, contexte, permissions, évaluation et amélioration continue. Signe de ce virage, AutoGPT n'a quasiment pas été mentionné cette année, les discussions portant plutôt sur Claude Code, Codex, Gemini CLI, Cursor et Warp. Lors du keynote OpenAI du deuxième jour, Romain Huet a résumé l'ambiance en affirmant que "les AI engineers dévorent le monde", tandis que Thariq Shihipar, d'Anthropic, a comparé le nouveau modèle Claude Fable à un système organique : "les modèles se cultivent, ils ne se conçoivent pas", évoquant une progression de capacités "en pics" difficile à anticiper. La prochaine édition d'AI Engineer se tiendra à New York du 12 au 14 octobre 2026, avec un accent particulier sur l'IA dans la finance. Cette évolution compte parce qu'elle acte la fin du fantasme d'agents totalement autonomes, popularisé en 2023 par le battage autour d'AutoGPT. L'industrie a appris que l'autonomie complète des agents n'est ni fiable ni même souhaitable à grande échelle : les entreprises présentes au salon ont positionné les agents comme des outils augmentant le travail des ingénieurs, pas comme des remplaçants. Pour les équipes techniques, cela signifie investir moins dans la sophistication du prompt ou du modèle brut, et davantage dans l'infrastructure de fiabilité autour de lui : gestion du contexte, permissions, évaluation continue des sorties, et supervision humaine. Ce constat s'inscrit dans un contexte plus large d'incertitude, même chez les laboratoires de pointe, sur la manière dont leurs propres modèles évoluent réellement. La reconnaissance par Anthropic d'une "capability overhead" imprévisible chez Claude Fable illustre cette difficulté à garder le contrôle sur des systèmes de plus en plus complexes. D'où l'émergence d'une deuxième tendance identifiée lors du salon, celle du "loop engineering" comme nouvelle couche de contrôle, les boucles d'exécution des agents devenant elles-mêmes un objet d'ingénierie à part entière, au même titre que le modèle ou le harnais qui l'entoure.

💬 AutoGPT quasiment aux abonnés absents cette année, ça dit tout. Trois ans après le délire sur les agents totalement autonomes, l'industrie a compris que ça ne tient pas à grande échelle, et que le vrai boulot c'est le harnais autour : contexte, permissions, évaluation continue. L'AI engineering est en train de passer de la promesse de robots qui bossent tout seuls à la construction de plomberie fiable, et c'est bien plus solide que ça en a l'air.

OutilsOutil
1 source
Les articles les plus marquants d'ICML
1955The Information AI 

Les articles les plus marquants d'ICML

La Conférence internationale sur l'apprentissage automatique (ICML) s'est tenue la semaine dernière à Séoul, réunissant des chercheurs en intelligence artificielle venus du monde entier. Les échanges ont porté principalement sur de nouvelles méthodes pour entraîner et faire fonctionner les modèles de façon plus efficace, un sujet technique au cœur des préoccupations actuelles du secteur. Les participants ont également abordé la question de l'automatisation de leurs propres emplois par l'IA, un thème suffisamment marquant pour faire l'objet d'une newsletter séparée publiée samedi. Sur place, le stand d'OpenAI a attiré beaucoup de monde, tandis qu'Anthropic n'avait presque pas de présence visible lors de l'événement. La coïncidence de calendrier profite à OpenAI: la conférence s'est achevée juste avant qu'Apple ne dépose une plainte retentissante accusant d'anciens ingénieurs et concepteurs de dispositifs, désormais employés par OpenAI, d'avoir dérobé des secrets commerciaux en quittant l'entreprise à la pomme. Cette proximité temporelle signifie que le litige n'a pas pu peser sur l'ambiance de l'ICML, où l'attention est restée concentrée sur la recherche plutôt que sur les tensions juridiques entre géants de la tech. Cet épisode illustre la position actuelle d'OpenAI, à la fois moteur visible de l'écosystème académique et cible de contentieux liés au débauchage de talents chez ses concurrents historiques comme Apple. La faible visibilité d'Anthropic lors d'un rendez-vous scientifique majeur contraste avec l'omniprésence d'OpenAI, reflet des stratégies différentes des deux laboratoires en matière de communication et de recrutement. Les enjeux soulevés à Séoul, efficacité des modèles et impact de l'IA sur l'emploi des chercheurs eux-mêmes, devraient continuer d'alimenter les débats dans les prochains mois, alors que la bataille judiciaire entre Apple et OpenAI ne fait que commencer.

BusinessActu
1 source
ChatGPT peut désormais écouter et parler en même temps, rendant les conversations avec l'IA plus naturelles
1956The Decoder 

ChatGPT peut désormais écouter et parler en même temps, rendant les conversations avec l'IA plus naturelles

Voici le texte traduit et résumé : ChatGPT peut désormais écouter et parler en même temps grâce à GPT-Live, une nouvelle architecture full-duplex développée par OpenAI. Concrètement, l'assistant vocal n'a plus besoin d'attendre la fin de la phrase de l'utilisateur pour commencer à répondre, ce qui rend les échanges beaucoup plus fluides. Pour les questions complexes, le système bascule discrètement en arrière-plan vers GPT-5.5, un modèle plus puissant, avant de restituer la réponse à l'oral. GPT-Live-1, la version complète, est déjà disponible pour les abonnés payants de ChatGPT, tandis qu'une version allégée, GPT-Live-1-mini, équipe les comptes gratuits. L'accès via l'API doit suivre dans les prochaines semaines. Cette avancée technique change concrètement la nature des interactions vocales avec l'IA. Jusqu'ici, les assistants conversationnels fonctionnaient sur un mode séquentiel rigide : l'utilisateur parle, puis attend, puis l'IA répond. Avec le full-duplex, les interruptions, hésitations et reformulations en cours de phrase deviennent possibles, comme dans une vraie conversation humaine. Pour les usages professionnels comme l'assistance client ou la dictée assistée, cela réduit la friction et améliore l'expérience perçue, un facteur clé alors que les entreprises cherchent à déployer des agents vocaux plus naturels. Cette évolution s'inscrit dans la course entre grands acteurs de l'IA générative pour rendre les interfaces vocales indiscernables d'une conversation humaine, un terrain où Google et son assistant Gemini, ainsi que d'autres concurrents, investissent également massivement. Le choix d'OpenAI de combiner un modèle léger pour la fluidité conversationnelle et un modèle lourd, GPT-5.5, pour la profondeur de raisonnement illustre une stratégie d'architecture hybride qui pourrait s'imposer comme standard. Reste à voir comment cette technologie se comportera à grande échelle une fois ouverte aux développeurs via l'API, et si la latence promise tiendra ses promesses en conditions réelles d'usage.

Gérer les applications d'IA sur Mac avec Jamf AI Governance et Amazon Bedrock
1957AWS ML Blog 

Gérer les applications d'IA sur Mac avec Jamf AI Governance et Amazon Bedrock

Jamf, dont la plateforme de gestion d'appareils Apple est utilisée par plus de 78 000 organisations dans le monde, a annoncé une extension de sa fonctionnalité AI Governance permettant de gérer les applications d'intelligence artificielle sur les Mac professionnels via Amazon Bedrock. Concrètement, cette intégration permet aux administrateurs informatiques de configurer et déployer de manière centralisée des applications comme Claude Code, Claude Desktop et OpenAI Codex sur l'ensemble d'un parc de Mac, en s'appuyant sur la Declarative Device Management (DDM) d'Apple. Les équipes IT peuvent ainsi définir dans Jamf des politiques précisant l'authentification, la région AWS utilisée pour l'inférence, l'accès aux modèles, ainsi que des paramètres plus fins comme les niveaux d'effort, les connexions aux serveurs MCP (Model Context Protocol), les permissions d'accès aux dossiers locaux, le sandboxing ou encore la télémétrie. Ces politiques sont ensuite déployées via les Jamf Blueprints vers des groupes de Mac ciblés, et les utilisateurs peuvent ouvrir directement les applications sans configuration manuelle, l'ensemble des réglages étant poussé automatiquement avant leur premier lancement. Cette annonce répond à un problème concret pour les entreprises qui déploient l'IA générative à grande échelle : jusqu'ici, chaque application tournant en local sur les postes des employés nécessitait une configuration manuelle de fichiers, rendant difficile tout contrôle centralisé sur l'endroit où s'exécute l'inférence et sur la manière dont les données transitent. En connectant ces applications à Amazon Bedrock plutôt qu'à des API tierces non maîtrisées, les organisations gardent l'inférence dans leur propre périmètre de sécurité AWS, un point clé pour les secteurs régulés ou les grandes entreprises soucieuses de la confidentialité de leurs données. Jamf met aussi en avant un bénéfice économique concret : l'activation du cache de prompts (prompt caching) sur Bedrock via cette intégration peut réduire les coûts d'utilisation de Claude Code jusqu'à 90 % et la latence jusqu'à 85 % sur les modèles compatibles, un argument important pour les équipes de développement qui utilisent ces outils de façon intensive et répétitive. Cette évolution s'inscrit dans une tendance plus large où les éditeurs de solutions de gestion de flotte, historiquement concentrés sur la sécurité des terminaux et les mises à jour logicielles, étendent leur périmètre à la gouvernance de l'IA générative en entreprise. À mesure que des outils comme Claude Code ou Codex s'intègrent aux flux de travail quotidiens des développeurs, les directions informatiques cherchent des garde-fous équivalents à ceux déjà appliqués aux applications classiques : traçabilité, conformité, et résistance aux modifications locales non autorisées. Le partenariat entre Jamf et AWS pourrait ainsi préfigurer d'autres intégrations similaires avec des fournisseurs de gestion d'appareils, à mesure que la pression réglementaire et les besoins d'audit autour de l'IA en entreprise continuent de croître.

💬 Selon Le Fil IA, quand la gestion de flotte s'attaque à la gouvernance IA, c'est le signal que Claude Code et Codex sont passés d'outils de dev à applis d'entreprise à part entière, avec tout ce que ça implique en audit et conformité. Le détail qui compte vraiment c'est le prompt caching sur Bedrock, moins 90% de coûts, ça c'est du concret pour les équipes qui tournent ces outils en boucle toute la journée. Reste que c'est un partenariat AWS-Jamf, donc si ton infra est ailleurs (Azure, GCP), t'attends encore ton tour.

OutilsActu
1 source
Vous pouvez fermer votre PC : Claude continue de travailler sur votre smartphone
1958Le Big Data 

Vous pouvez fermer votre PC : Claude continue de travailler sur votre smartphone

Bonne nouvelle pour les utilisateurs assidus de l'intelligence artificielle : Claude Cowork, l'outil d'automatisation de tâches d'Anthropic, quitte son cocon de bureau. Lancé initialement en version desktop début 2026, il est désormais accessible depuis le 7 juillet sur navigateur web et sur smartphone, via l'application Claude disponible sur iOS et Android. Pour l'instant, cette extension est réservée aux abonnés de la formule Max, la plus onéreuse du catalogue Anthropic, avec la promesse d'une ouverture progressive à d'autres formules dans les semaines à venir. Le principe reste simple : un utilisateur confie une tâche complexe à Claude depuis son ordinateur, ferme la machine, puis suit l'avancement du travail et le récupère directement sur son téléphone. Pour accompagner ce lancement, Anthropic prolonge jusqu'au 5 août le doublement des limites d'utilisation de Cowork, une manière d'inciter les utilisateurs à tester des projets plus ambitieux sur cette nouvelle version mobile. Cette annonce marque une étape supplémentaire dans la banalisation des agents IA capables de travailler en arrière-plan, sans supervision continue de l'utilisateur. En rendant Cowork accessible sans installation de logiciel dédié, Anthropic élargit considérablement son public potentiel : plus besoin d'un poste de travail équipé pour lancer ou suivre une mission confiée à l'IA. Pour les professionnels submergés, cela change concrètement l'organisation du travail, avec la possibilité de vérifier ou valider l'avancement d'une tâche entre deux réunions ou en dehors du bureau, un simple smartphone suffisant désormais pour reprendre la main lorsqu'une validation humaine est nécessaire. Anthropic reste toutefois prudent sur les usages les plus exigeants : les tâches lourdes, qui nécessitent un accès aux fichiers stockés localement ou à un navigateur complet, demeurent mieux adaptées à l'application de bureau, qui conserve seule l'ensemble des fonctionnalités. Cette évolution s'inscrit dans une course plus large entre les grands acteurs de l'IA générative pour transformer leurs assistants en véritables collaborateurs autonomes, capables de mener des projets de bout en bout plutôt que de simplement répondre à des requêtes ponctuelles. Anthropic recommande d'ailleurs aux utilisateurs de ne pas repartir de zéro avec Cowork, mais de s'appuyer sur un projet déjà entamé, qu'il s'agisse d'un dossier, d'une présentation ou d'un fil de discussion, avant de préciser à l'IA le résultat final attendu. Reste à voir comment les concurrents, notamment OpenAI et Google, répondront à cette montée en puissance des agents mobiles, dans un secteur où l'accessibilité et la continuité entre les appareils deviennent des arguments commerciaux de plus en plus décisifs.

OutilsOutil
1 source
Mes réflexions sur Fable
1959Ben's Bites 

Mes réflexions sur Fable

Aujourd'hui marque le dernier jour où Fable est inclus gratuitement dans les abonnements Claude d'Anthropic : dès demain, son usage nécessitera l'achat de crédits séparés. Un utilisateur régulier raconte avoir passé la semaine à converser avec Fable dans une session unique et prolongée, exploitant sa gestion de la mémoire, la compaction des échanges et l'écriture de fichiers, qu'il juge impressionnante. Il a également fait appel à Codex et à Droid comme sous-agents, au point d'épuiser plus vite son quota Codex que celui de Claude Code. Anthropic a par ailleurs publié une nouvelle recherche en interprétabilité montrant que Claude mobilise un « espace de travail global » activant des concepts qui n'apparaissent ni dans la réponse finale ni dans la chaîne de raisonnement visible, mais qui influencent malgré tout son comportement, un mécanisme que les chercheurs comparent à une forme de pensée inconsciente. Du côté d'OpenAI, The Information rapporte que l'entreprise a trouvé un moyen de réduire de moitié le coût d'inférence de ses modèles, déjà testé sur les utilisateurs non connectés de ChatGPT, la dernière baisse de prix majeure remontant à un an avec la réduction de 80% du coût d'o3. Ces annonces comptent parce qu'elles redessinent la manière dont les professionnels choisissent et utilisent leurs outils d'IA au quotidien. La fin de la gratuité de Fable pousse les utilisateurs à repenser leur rapport à un outil qu'ils décrivent moins comme un assistant de développement que comme un véritable partenaire de réflexion, capable de connexions créatives que d'autres modèles peinent à reproduire. Cette bascule illustre aussi une tension plus large dans l'industrie entre agents conçus pour coder efficacement, comme Codex jugé plus rapide et plus abouti, et des harnais pensés pour le brainstorming, où la vitesse compte moins que la profondeur de pensée. Une éventuelle baisse des coûts d'inférence chez OpenAI pourrait, si elle s'étend aux API payantes, rendre l'usage intensif de ces modèles plus accessible aux développeurs et entreprises, un enjeu economique important dans un secteur ou les couts de calcul restent le principal frein a l'adoption a grande echelle. Le contexte plus large est celui d'une accélération attendue cette semaine avec l'arrivée annoncée de GPT-5.6, potentiellement dans sa variante Sol, censée rivaliser avec les capacités créatives et de raisonnement d'Anthropic. Parmi les autres sorties notables figure GPT-Realtime-2.1-mini, un nouveau modèle de l'API OpenAI capable de traiter de la vidéo en entrée et de produire de l'audio tout en effectuant du raisonnement et des appels d'outils. Un projet distinct, MIRA, a par ailleurs entraîné un modèle de monde jouable sur 10 000 heures de parties façon Rocket League, donnant une sensation de jeu réel malgré des graphismes sommaires. Sponsorisée par Adobe Firefly, cette actualité s'accompagne du déploiement de nouvelles capacités agentiques pour l'outil, incluant la création de chartes de marque, de vidéos produits courtes, un montage automatique baptisé Quick Cut et la génération de storyboards, signe que la course à l'intégration de l'IA générative dans les usages créatifs professionnels continue de s'intensifier sur tous les fronts.

UEUne éventuelle baisse du coût d'inférence des API OpenAI profiterait aussi aux développeurs et entreprises européens qui les utilisent.

💬 La fin de la gratuité de Fable, c'est le signal qu'on sort de l'ère où l'IA générative se distribuait comme un bonus marketing : à partir de maintenant, on paie pour ce que l'outil vaut vraiment, pas pour l'abonnement qui l'englobe gratuitement. La recherche d'Anthropic sur la "pensée inconsciente" de Claude est fascinante, mais ça reste du labo, pas du produit. Le vrai enjeu, il est chez OpenAI, qui coupe son coût d'inférence en deux : si ça arrive sur l'API payante, ça change la donne pour tous ceux qui tournent ces modèles en prod.

LLMsActu
1 source
Fine-tuner l'entreprise : le reinforcement learning en pratique
1960InfoQ AI 

Fine-tuner l'entreprise : le reinforcement learning en pratique

Fin novembre 2025, lors d'une présentation intitulée « Fine Tuning the Enterprise: Reinforcement Learning in Practice », les intervenants Wenjie Zi et Will Hang ont détaillé Agent RFT, la plateforme d'OpenAI dédiée au fine-tuning de modèles de raisonnement par apprentissage par renforcement. Le principe repose sur des interactions en temps réel avec des outils externes et des signaux de récompense personnalisés, définis par les entreprises clientes selon leurs propres critères de réussite. Les deux experts ont expliqué comment cette approche permet de résoudre un problème technique complexe connu sous le nom d'assignation de crédit, c'est-à-dire déterminer quelles étapes précises d'un raisonnement long ont réellement contribué au résultat final, à l'intérieur même de la fenêtre de contexte du modèle. Cette avancée compte particulièrement pour les entreprises qui déploient des agents IA sur des tâches complexes et répétitives. Selon les retours d'expérience partagés lors de la présentation, Agent RFT permet d'éliminer les boucles de tokens improductives en fin de raisonnement, un phénomène fréquent où le modèle continue de générer du texte sans converger vers une solution. Le résultat concret est un gain d'efficacité important, avec une réduction du nombre de tokens consommés et donc des coûts d'inférence, tout en améliorant la fiabilité des réponses produites par les agents dans des contextes professionnels réels. Cette présentation s'inscrit dans une tendance plus large du secteur de l'IA, où les grands fournisseurs de modèles cherchent à donner aux entreprises davantage de contrôle sur le comportement de leurs agents via le fine-tuning par renforcement, plutôt que par le seul prompt engineering. OpenAI positionne ainsi Agent RFT comme un outil permettant aux équipes techniques de personnaliser finement les récompenses selon leurs propres métriques métier. Les cas d'usage cités suggèrent que cette technique pourrait devenir un standard pour les organisations cherchant à industrialiser des agents IA fiables et économes en ressources de calcul.

💬 Fine-tuning par renforcement plutôt que prompt engineering, c'est la vraie bascule ici : OpenAI donne aux boîtes le contrôle sur comment l'agent apprend, pas juste sur ce qu'on lui demande. L'assignation de crédit, c'est le vrai casse-tête technique du raisonnement long, et si Agent RFT le règle vraiment, ça change le calcul coût/fiabilité des agents en prod. Reste que "présenté lors d'une conf" et "ça tient à l'échelle chez un client lambda" sont deux choses différentes, donc j'attends de voir des chiffres indépendants avant de crier au standard du secteur.

LLMsOutil
1 source
Alibaba dévoile Page Agent, un agent IA JavaScript qui contrôle les interfaces web en langage naturel via le DOM
1961MarkTechPost 

Alibaba dévoile Page Agent, un agent IA JavaScript qui contrôle les interfaces web en langage naturel via le DOM

Alibaba a mis en ligne Page Agent, une bibliothèque open source sous licence MIT qui transforme n'importe quelle application web en interface pilotable par commandes en langage naturel. Contrairement à Playwright, Puppeteer, Selenium ou browser-use, qui pilotent un navigateur depuis un processus externe en lisant des captures d'écran ou en passant par le protocole Chrome DevTools, Page Agent s'exécute directement à l'intérieur de la page, sous forme de simple code JavaScript. Le codebase est écrit en TypeScript et s'appuie sur browser-use, dont il reprend le traitement du DOM et les prompts. Sa technique centrale, baptisée « déshydratation du DOM », consiste à scanner le Document Object Model dès qu'une commande arrive, à repérer chaque élément interactif (boutons, liens, champs de saisie), puis à lui attribuer un index, un rôle et un libellé. Le résultat est un « FlatDomTree », une carte textuelle compacte de la page, débarrassée du balisage superflu, que le modèle de langage lit à la place des pixels. Le projet est structuré en plusieurs paquets : @page-agent/core pour la logique de l'agent, page-agent pour la classe complète avec panneau d'interface, et @page-agent/page-controller pour l'extraction du DOM et l'indexation des éléments. Cette approche change la donne parce que l'agent tourne dans la session même du navigateur : il hérite automatiquement des cookies, de la session et de l'authentification de l'utilisateur, sans nécessiter de backend séparé, tout en conservant les règles de validation et de sécurité déjà présentes dans l'interface. Comme seul du texte est envoyé au modèle, un modèle de langage classique, même de taille modeste, suffit à faire fonctionner l'agent, ce qui réduit les coûts par rapport aux approches multimodales fondées sur des captures d'écran. Page Agent reste agnostique vis-à-vis du fournisseur de modèle: n'importe quel point d'accès compatible avec l'API OpenAI peut être branché. Les développeurs gardent la main sur le périmètre d'action grâce à des listes d'autorisation d'opérations, au masquage de données sensibles comme les mots de passe, et à l'injection de règles métier personnalisées. L'usage principal visé est la création de copilotes intégrés à une application ou d'assistants de remplissage de formulaires. Cette architecture s'inscrit dans un paysage plus large d'outils d'automatisation web, où des solutions comme Selenium ou Playwright dominent pour les tests de bout en bout scriptés, browser-use pour les agents autonomes multi-sites capables de vision, et WebMCP pour l'accès natif à des outils via des appels de fonctions structurés côté serveur. Page Agent se distingue en misant sur des applications que l'on maîtrise et où l'on peut ajouter du code, plutôt que sur le scraping de sites externes ou verrouillés. Ses limites restent réelles: la sécurité s'appuie sur le niveau du prompt et son périmètre se cantonne à une seule page, ce qui impose de conserver une validation côté serveur pour toute action sensible.

OutilsOutil
1 source
Nous Research enrichit Hermes d'une commande /learn pour capturer les workflows en commandes slash sans rédiger SKILL.md
1962MarkTechPost 

Nous Research enrichit Hermes d'une commande /learn pour capturer les workflows en commandes slash sans rédiger SKILL.md

Nous Research a enrichi son agent open-source Hermes Agent avec une nouvelle commande baptisée /learn, annoncée le 23 juin 2026. Cette fonctionnalité s'intègre au système de compétences existant (Skills System) de l'agent et permet de créer automatiquement des fichiers SKILL.md réutilisables sans avoir à les rédiger manuellement. Il suffit de pointer la commande vers une source : un répertoire local comme ~/projects/acme-sdk, une URL de documentation en ligne, des notes collées dans le terminal, ou même une procédure que l'utilisateur vient de lui faire exécuter. L'agent mobilise alors ses propres outils, readfile et searchfiles pour les fichiers locaux, web_extract pour le web, et produit une fiche de compétence conforme aux standards maison : description en moins de 60 caractères, structure de sections normalisée, et référencement uniquement aux commandes qui existent réellement. Toutes les compétences sont stockées dans ~/.hermes/skills/ et deviennent instantanément des commandes slash disponibles, comme /plan ou /axolotl. L'enjeu derrière cette simplicité apparente est considérable pour les équipes techniques. Jusqu'ici, documenter un workflow complexe, déployer un serveur, soumettre une note de frais, interagir avec une API interne, exigeait que quelqu'un rédige manuellement ce fichier de référence. Avec /learn, l'agent se charge lui-même de cette capitalisation, transformant une procédure fraîchement exécutée en compétence persistante et réutilisable. Le système de chargement à trois niveaux maintient les coûts en tokens sous contrôle : l'agent dispose en permanence d'un index compact (environ 3 000 tokens), et ne charge le contenu complet d'une compétence que lorsqu'une tâche le requiert explicitement. Une bibliothèque de dizaines de compétences ne pèse donc pas sur la fenêtre de contexte au repos. Hermes Agent est le projet phare de Nous Research dans l'espace des agents auto-améliorants open-source. Le Skills System repose sur le standard ouvert agentskills.io, ce qui lui confère une dimension communautaire : les compétences créées localement, installées depuis un hub tiers ou générées automatiquement partagent le même format et le même emplacement. /learn n'est pas un moteur d'ingestion séparé mais simplement une instruction transmise à l'agent comme un tour de conversation ordinaire, ce qui le rend compatible avec tous les modes d'exécution, CLI, interface TUI, passerelle de messagerie, tableau de bord, Docker ou remote. L'approbation manuelle reste possible via une option de contrôle des écritures. Cette architecture place Nous Research dans une logique de mémoire procédurale automatique pour les agents, un chantier sur lequel plusieurs laboratoires rivaux, dont Anthropic et OpenAI, cherchent eux aussi à progresser dans leurs propres écosystèmes d'agents.

OutilsOutil
1 source
Les 16 meilleurs outils IA génératives pour le code en 2026 : comparatif et cas d'usage
1963MarkTechPost 

Les 16 meilleurs outils IA génératives pour le code en 2026 : comparatif et cas d'usage

En 2026, les outils de génération de code alimentés par l'intelligence artificielle ont profondément transformé la manière dont les développeurs construisent des logiciels. Ce qui n'était, il y a quelques années, qu'un simple système d'autocomplétion ligne par ligne est devenu une infrastructure capable de générer des applications entières, des pipelines multi-agents et des interfaces en langage naturel pour des bases de code complexes. Parmi les seize outils recensés cette année, plusieurs se démarquent nettement. Atoms se positionne comme une plateforme qui transforme une description en langage naturel en application déployable complète, avec frontend, backend, base de données, authentification et paiements Stripe intégrés via Atoms Cloud. Son mode Race Mode permet de faire tourner plusieurs modèles ou équipes d'agents en parallèle sur le même prompt pour comparer les résultats. GitHub Copilot, développé par GitHub et OpenAI, reste l'assistant le plus utilisé avec ses suggestions en temps réel dans VS Code, Visual Studio et JetBrains, désormais enrichies de modes agents pour les modifications multi-fichiers. Tabnine mise sur la confidentialité en permettant aux équipes de faire tourner les modèles sur leur propre infrastructure. Replit offre un environnement de développement cloud complet avec déploiement intégré, tandis que Warp modernise le terminal en traduisant le langage naturel en commandes shell exécutables. L'impact de ces outils est concret et immédiat pour les ingénieurs logiciels, les data scientists et les développeurs indépendants. Ils réduisent drastiquement le temps de prototypage, éliminent les tâches répétitives d'infrastructure et abaissent la barrière d'entrée pour lancer des produits numériques. Des plateformes comme Atoms ou Replit permettent aujourd'hui de passer d'une idée à une application fonctionnelle en quelques heures sans configuration locale, ce qui modifie structurellement les coûts de développement et la vitesse de mise sur le marché pour les startups comme pour les grandes entreprises. Hugging Face, de son côté, reste une ressource centrale pour les équipes qui souhaitent s'appuyer sur des modèles open source pour l'autocomplétion, la refactorisation ou l'explication de code, sans dépendre de solutions propriétaires. Ce mouvement s'inscrit dans une évolution rapide du marché depuis l'émergence des grands modèles de langage entraînés sur du code, notamment GPT-4, Gemini et les modèles spécialisés comme StarCoder. La concurrence s'est intensifiée entre solutions propriétaires et open source, entre outils intégrés à l'éditeur et plateformes autonomes de génération d'applications. Les enjeux portent désormais sur la confidentialité des données, la qualité du code produit, l'intégration dans les workflows existants et la capacité à gérer des projets de grande envergure. La prochaine phase d'évolution semble pointer vers des agents capables de gérer l'intégralité du cycle de vie logiciel, de la conception à la maintenance, avec une intervention humaine réduite à la validation.

UEHugging Face, entreprise française, est identifiée comme ressource centrale pour les équipes souhaitant s'appuyer sur des modèles open source sans dépendance aux solutions propriétaires américaines.

OutilsOutil
1 source
Créez des vidéos de foot virales gratuitement avec l’IA (Chaîne Youtube sur la Coupe du Monde 2026)
1964Le Big Data 

Créez des vidéos de foot virales gratuitement avec l’IA (Chaîne Youtube sur la Coupe du Monde 2026)

Un tutoriel publié sur YouTube et relayé par LeBigData.fr démontre qu'il est désormais possible de produire des vidéos virales sur la Coupe du Monde 2026 sans budget ni compétences en montage, en s'appuyant exclusivement sur des outils gratuits d'intelligence artificielle. Le workflow présenté s'articule autour de cinq plateformes enchaînées : ChatGPT génère en quelques secondes un plan complet incluant les prompts d'images, le script de voix off et le découpage scène par scène. Les visuels sont ensuite produits via Nano Banana 2 sur Flow AI ou Piclumen, qui offre une vingtaine de crédits gratuits par jour. La plateforme Wan anime ces images en séquences vidéo fluides, et CapCut assure le montage final avec voix off et musique. Ce type de contenu représente une rupture concrète dans la création vidéo grand public. Ce qui nécessitait auparavant une équipe de production, un logiciel payant comme Premiere Pro ou After Effects, et plusieurs heures de travail peut désormais être accompli par n'importe quel débutant en moins d'une heure. Pour les créateurs de contenu indépendants, les petits médias ou les passionnés de sport, l'accès à un pipeline de production professionnel sans investissement financier change radicalement les règles du jeu sur des plateformes comme YouTube ou TikTok, où la vitesse de publication et le volume de contenu sont déterminants. Ce tutoriel s'inscrit dans une vague plus large d'outils génératifs qui démocratisent la production audiovisuelle. Des plateformes comme Runway, Pika ou Sora d'OpenAI ont ouvert la voie à la génération vidéo par IA, mais restent souvent payantes ou en accès limité. La combinaison d'outils gratuits présentée ici constitue une alternative crédible et immédiatement utilisable. Avec la Coupe du Monde 2026 qui se déroulera aux États-Unis, au Canada et au Mexique à partir du 11 juin, l'événement représente une opportunité massive pour les créateurs cherchant à capter une audience sportive mondiale, et les outils IA pourraient y jouer un rôle inédit dans la production de contenu amateur à grande échelle.

CréationTuto
1 source
Ampersend crée un modèle de paiement à l'usage pour agents IA avec Amazon Bedrock AgentCore Payments
1965AWS ML Blog 

Ampersend crée un modèle de paiement à l'usage pour agents IA avec Amazon Bedrock AgentCore Payments

Ampersend, une plateforme de gestion des paiements pour agents IA développée par Edge & Node, a annoncé la mise en production d'une couche de routage pay-per-intelligence construite sur Amazon Bedrock AgentCore Payments. Le système permet à des agents autonomes de sélectionner dynamiquement un modèle de langage adapté à leur tâche, résumé de document, audit de smart contract, analyse de données on-chain, puis de régler la prestation par requête, sans intervention humaine, en s'appuyant sur le protocole ouvert x402. L'infrastructure repose sur un mécanisme en deux sauts : l'agent appelle Ampersend, qui règle ensuite le fournisseur de modèle en aval via son propre SDK. Le tout se pilote depuis un point d'intégration unique, sans abonnement distinct par fournisseur. Jusqu'ici, connecter un agent IA à des services payants réclamait des mois de travail préalable : gestion de portefeuilles cryptographiques, signature des paiements, respect des limites de dépenses, intégration avec la facturation de chaque fournisseur. Ce fardeau infrastructure freinait considérablement le déploiement d'agents en production. AgentCore Payments supprime ce prérequis en offrant une couche de gouvernance clé en main : un Payment Manager définit les règles de dépense et les connexions aux portefeuilles, tandis qu'une Payment Session ouvre un contexte d'exécution borné avant chaque run d'agent. Résultat concret pour les développeurs : ils écrivent la logique métier de l'agent sans s'occuper de la plomberie financière. Pour des plateformes comme Ampersend, c'est la possibilité d'agréger des dizaines de fournisseurs de modèles derrière une interface de paiement unique, sécurisée et auditée nativement. Ce lancement s'inscrit dans une tendance plus large : l'émergence d'une économie machine-to-machine où les agents IA deviennent des acteurs économiques à part entière, capables de consommer des APIs payantes de façon autonome. Le protocole x402, sur lequel repose l'architecture, est conçu pour des transactions programmatiques instantanées, à l'image de ce qu'HTTP fait pour les échanges de données. Amazon, avec Bedrock AgentCore, consolide sa position d'infrastructure sous-jacente pour les stacks agentiques d'entreprise, aux côtés de ses outils d'orchestration existants. Ampersend, de son côté, parie que la fragmentation du marché des modèles, OpenAI, Anthropic, modèles open source, spécialistes verticaux, rendra indispensable ce type de couche d'abstraction de paiement. Les prochaines étapes probables incluent l'extension du catalogue de modèles, des politiques de dépense plus granulaires, et l'intégration avec d'autres protocoles de paiement agentic émergents.

InfrastructureActu
1 source
Les 15 meilleurs outils de vibe coding en 2026 : prix, fonctionnalités et cas d'usage
1966MarkTechPost 

Les 15 meilleurs outils de vibe coding en 2026 : prix, fonctionnalités et cas d'usage

En 2026, le "vibe coding" s'est imposé comme l'approche dominante du développement logiciel assisté par IA. Le principe, popularisé par Andrej Karpathy, ancien directeur de l'IA chez Tesla et OpenAI, consiste à décrire en langage naturel ce que l'on veut construire, puis à laisser un agent IA générer le code correspondant. Le développeur fixe la direction et valide le résultat, l'agent prend en charge l'essentiel de l'implémentation. Une comparaison récente de quinze outils phares illustre la diversité des approches disponibles : des plateformes agents complètes comme Atoms, qui mobilise une équipe d'agents spécialisés couvrant architecture, SEO et intégration Stripe pour livrer une application prête à déployer, jusqu'aux IDE natifs IA comme Cursor, qui conserve le développeur au coeur du code tout en automatisant les modifications multi-fichiers via son "Agent Mode". D'autres acteurs majeurs figurent dans ce panorama : Replit, environnement entièrement navigateur sans installation locale, idéal pour le prototypage rapide ; Claude Code d'Anthropic, interface en ligne de commande avec mémoire de projet persistante ; GitHub Copilot, désormais capable d'exécuter des tâches complètes depuis une invite en langage naturel ; et Windsurf avec son agent Cascade orienté collaboration en temps réel. Cette évolution réduit concrètement le coût du passage de l'idée au prototype. Un fondateur peut désormais tester un concept sans recruter une équipe d'ingénieurs. Un développeur expérimenté peut déléguer le code répétitif pour se concentrer sur l'architecture. Les cycles d'itération raccourcissent, les boucles de feedback se resserrent. Pour l'industrie, cela signifie que la barrière technique à la création de logiciels s'abaisse significativement, ce qui ouvre le développement à des profils non-ingénieurs tout en augmentant la productivité des développeurs chevronnés. Le choix entre ces outils repose sur un arbitrage central : jusqu'où déléguer à l'agent et combien garder de contrôle sur le code produit. Le vibe coding s'inscrit dans une tendance plus large portée par la montée en puissance des grands modèles de langage, notamment ceux d'Anthropic, OpenAI et Google, qui alimentent la plupart de ces outils. La capacité d'un outil à comprendre une base de code existante, à gérer des projets de grande taille, et à s'intégrer dans des workflows de revue via des pull requests devient un critère de sélection clé, en particulier pour les équipes d'entreprise soumises à des règles strictes en matière de confidentialité des données. La prochaine étape probable est l'automatisation complète de bout en bout, de la spécification produit au déploiement en production, un territoire où Atoms se positionne déjà, mais que Cursor, Copilot et Replit approchent chacun par des voies différentes. Le développeur de 2026 choisit moins son langage que son niveau d'autonomie accordé à la machine.

OutilsOutil
1 source
Prompt vidéo IA, la méthode simple pour obtenir un rendu pro
1967Le Big Data 

Prompt vidéo IA, la méthode simple pour obtenir un rendu pro

La maîtrise du prompt vidéo IA s'impose progressivement comme une compétence professionnelle à part entière dans l'écosystème de la création numérique. Les générateurs de vidéo par intelligence artificielle, parmi lesquels Seedance figure parmi les outils mis en avant, transforment des descriptions textuelles en séquences animées, à condition que ces descriptions soient suffisamment précises. Le principe de fonctionnement repose sur une réalité mathématique : les réseaux de neurones traduisent chaque terme du prompt en coordonnées tridimensionnelles, ce qui signifie que le choix des verbes d'action détermine directement la vitesse et le réalisme de l'animation produite. Un sujet principal clairement défini, un environnement décrit avec des éléments tangibles, et des indications d'éclairage précises, lumière dorée, ombres portées douces, heure de la journée, constituent les marqueurs d'une requête bien construite. L'enjeu dépasse le simple confort d'utilisation : un prompt mal formulé pousse le modèle à combler les zones d'imprécision par des éléments générés aléatoirement, ce qui se traduit concrètement par des erreurs d'anatomie, des déformations visuelles et une incohérence globale dans la séquence. À l'inverse, une description rigoureuse réduit drastiquement ces artefacts et permet de stabiliser l'arrière-plan tout au long de l'animation. Pour les créateurs de contenu qui produisent à volume, que ce soit pour les réseaux sociaux, la publicité ou la communication d'entreprise, cette précision technique représente un gain de temps direct et une réduction des itérations coûteuses. La qualité graphique finale dépend moins de la puissance de l'outil que de la qualité de l'instruction qui lui est donnée. Cette évolution s'inscrit dans un contexte de démocratisation rapide de la vidéo générée par IA, où la barrière d'entrée technique s'abaisse mais où l'écart entre un résultat amateur et un résultat professionnel se déplace vers la capacité à formuler des instructions pertinentes. Les grandes plateformes de génération vidéo, Sora d'OpenAI, Runway, Kling, et des acteurs plus récents comme Seedance, se multiplient et se différencient essentiellement par leurs capacités de traitement sémantique. Dans ce marché en consolidation, la compétence de rédaction de prompts tend à devenir un métier à part entière, parfois désigné sous le terme de "prompt engineering" dans les équipes créatives. La prochaine étape pour l'industrie sera probablement d'intégrer des assistants de rédaction de prompts directement dans les interfaces, réduisant encore davantage la courbe d'apprentissage pour les non-initiés.

CréationTuto
1 source
Google corrige plusieurs bugs dans les limites d'utilisation de Gemini qui épuisaient les quotas trop rapidement
1968The Decoder 

Google corrige plusieurs bugs dans les limites d'utilisation de Gemini qui épuisaient les quotas trop rapidement

Google a détecté et corrigé plusieurs bugs dans le système de quotas de son application Gemini, qui provoquaient une consommation anormalement rapide des limites d'utilisation. Le dysfonctionnement le plus grave permettait à seulement une ou deux vidéos générées via la fonctionnalité Omni d'épuiser la totalité du quota mensuel d'un abonné. Depuis le déploiement du correctif, les membres du plan Ultra bénéficient d'un nombre de générations vidéo doublé. Par ailleurs, les requêtes ayant échoué ne sont désormais plus déduites du quota, une pratique qui pénalisait injustement les utilisateurs en cas d'erreur technique. Ces corrections représentent un gain concret pour les abonnés Gemini Ultra, dont l'abonnement premium était de fait sous-utilisé à cause de bugs invisibles. Facturer des générations ratées ou laisser quelques vidéos saturer le quota d'un mois entier sape la confiance dans les offres payantes. Le doublement du quota vidéo améliore directement la valeur perçue du plan Ultra, dans un contexte de concurrence intense entre plateformes d'IA générative, où la fiabilité des engagements commerciaux pèse autant que les capacités techniques. Ces bugs surviennent alors que Google cherche à imposer Gemini face à des concurrents comme OpenAI, dont l'outil de génération vidéo Sora monte en puissance. La gestion des quotas est un point sensible pour les utilisateurs payants, qui attendent une transparence totale sur leur consommation. Google a annoncé vouloir renforcer cette transparence pour d'autres types d'usage, ce qui laisse entendre que d'autres incohérences dans le système de quotas pourraient encore être identifiées et corrigées prochainement.

UELes abonnés européens du plan Gemini Ultra bénéficient des mêmes corrections de quota et du doublement des générations vidéo, sans impact réglementaire spécifique à la France ou l'UE.

OutilsActu
1 source
San Francisco accueille un club de combat de robots, General Catalyst fait le buzz
1969The Information AI 

San Francisco accueille un club de combat de robots, General Catalyst fait le buzz

Jeudi dernier, une boîte de nuit du quartier SoMa à San Francisco accueillait un spectacle pour le moins inhabituel : des combats de robots humanoïdes de la taille d'un enfant dans une cage octogonale, sur fond de musique électronique et d'un animateur en blazer à paillettes. L'événement, baptisé "Robot Fight Night and Dance Off", réunissait quelques centaines de spectateurs venus encourager des machines maladroites à se frapper mutuellement. Derrière ce cirque technologique se cache Nebius, une société de cloud computing cherchant à se faire connaître : les robots, fabriqués par la firme chinoise Unitree, avaient été entraînés et chorégraphiés par Ultimate Fighting Bots, une ligue de sports pour robots humanoïdes, sur la plateforme cloud de Nebius. Dans le même temps, General Catalyst, l'un des fonds de capital-risque les plus influents de la Silicon Valley, publiait une vidéo marketing qui a cumulé 2,5 millions de vues sur Twitter en quelques jours, déclenchant une vive polémique dans le milieu du venture capital. Ces deux événements illustrent, chacun à leur manière, une forme de surchauffe dans l'industrie technologique. La robotique concentre aujourd'hui des sommes colossales : Jensen Huang de Nvidia y voit "la prochaine frontière de l'IA", Elon Musk présente Optimus comme "le plus grand produit de Tesla", et la startup Figure de Brett Adcock atteignait une valorisation de 39 milliards de dollars l'an dernier. Des dizaines de milliards ont été injectés dans des entreprises qui promettent de remplacer des millions de travailleurs dans les usines et les maisons de retraite. Transformer ces machines en attractions de combat revient, selon Shane Wilson, associé chez Citta Capital, à démontrer "le biais testostérone des startups en phase d'amorçage". La vidéo de General Catalyst, elle, a agacé Marc Andreessen et ses équipes : le personnage du capital-risqueur imprudent et peu sérieux qu'elle met en scène ressemble de façon troublante à Andreessen lui-même. Propulsée par ses réactions en ligne, la vidéo est devenue l'un des sujets les plus commentés entre investisseurs cette semaine, certains la qualifiant de "de mauvais goût". La soirée SoMa confirmait pourtant une chose : la révolution robotique annoncée ressemble pour l'instant moins à une armée de Terminators qu'à une procession de machines titubantes peinent à se porter des coups. Un ingénieur d'OpenAI présent dans la salle reconnaissait que les robots n'avaient guère progressé depuis un an. Quant à General Catalyst, habituellement discret dans les joutes verbales entre fonds, cette incursion dans le marketing viral marque un tournant dans la guerre d'image qui oppose les grandes firmes de la Silicon Valley. Le secteur du venture capital, sous pression alors que la bulle IA s'emballe, ne résiste plus à la tentation de la mise en scène, qu'il s'agisse de robots qui se battent maladroitement ou de vidéos qui règlent des comptes à peine voilés.

💬 Des robots humanoïdes qui trébuchent dans une cage octogonale pendant qu'un mec en blazer à paillettes crie dessus, c'est le meilleur résumé de l'état réel de la robotique en 2025. Un ingénieur d'OpenAI sur place qui admet que ça n'a pas bougé depuis un an, ça dit tout. La hype à 39 milliards pour Figure, les discours de Jensen Huang... bon, sur le papier ça claque, mais le produit, lui, peine encore à lever le bras sans tomber.

RobotiqueOpinion
1 source
Comment construire une intelligence de code au niveau dépôt avec Repowise : analyse de graphe, détection de code mort et contexte IA
1970MarkTechPost 

Comment construire une intelligence de code au niveau dépôt avec Repowise : analyse de graphe, détection de code mort et contexte IA

Repowise est un outil d'analyse de code qui propose une approche nouvelle pour comprendre la structure interne d'un dépôt logiciel à l'échelle du projet entier. Dans ce tutoriel pratique, les auteurs l'appliquent à itsdangerous, une bibliothèque Python de référence maintenue par Pallets, afin de démontrer comment configurer l'outil, connecter un modèle de langage (Claude Sonnet 4.5 d'Anthropic ou GPT-4o mini d'OpenAI selon les clés API disponibles), puis lancer le pipeline d'indexation qui génère un ensemble d'artefacts dans un répertoire .repowise/. L'outil peut également fonctionner en mode --index-only, sans LLM, pour les environnements sans accès à une API externe. Une fois initialisé, Repowise produit un graphe de dépendances entre fichiers et modules, qu'il analyse ensuite avec des algorithmes de théorie des graphes issus de la bibliothèque NetworkX, dont PageRank pour identifier les nœuds les plus influents et la détection de communautés pour regrouper les fichiers par cluster fonctionnel. Ce type d'intelligence repository-level répond à un problème concret que rencontrent les équipes de développement sur les bases de code volumineuses : savoir quels fichiers sont critiques, lesquels sont obsolètes, et comment les modifications en cascade se propagent. La détection de code mort, paramétrée ici avec un seuil de confiance à 0,7, permet d'identifier automatiquement les fichiers supprimables sans risque. La fonctionnalité de maintenance cascade_budget limite à 10 le nombre de fichiers touchés en cascade lors d'une modification, ce qui aide à estimer l'effort réel d'un refactoring avant de le commencer. La génération automatique d'un fichier CLAUDE.md, format de documentation structurée utilisé nativement par Claude Code d'Anthropic, facilite l'intégration du contexte architectural dans les workflows assistés par IA, en donnant au modèle une carte du projet plutôt qu'un tas de fichiers bruts. L'émergence d'outils comme Repowise s'inscrit dans une tendance plus large : donner aux LLMs une compréhension structurelle du code plutôt qu'une lecture séquentielle naïve. Là où les assistants classiques lisent fichier par fichier, une approche par graphes permet de raisonner sur les dépendances, la centralité et les clusters de responsabilité. Le protocole MCP (Model Context Protocol), sur lequel s'appuie Repowise pour exposer ses outils en CLI, est l'un des standards en cours d'adoption dans l'écosystème des agents de code. Le fait que l'outil génère directement un CLAUDE.md exploitable par Claude Code suggère une intégration croissante entre les outils d'analyse statique et les agents IA, une convergence qui pourrait redéfinir la façon dont les développeurs documentent et maintiennent les grandes bases de code à l'ère des assistants intelligents.

💬 Analyser un dépôt via un graphe de dépendances pour repérer le code mort et estimer l'impact d'un refactoring avant de le lancer, c'est exactement ce qu'il manque sur les grandes codebases. Ce qui m'intéresse le plus, c'est la génération auto du CLAUDE.md : si tu travailles avec Claude Code au quotidien, avoir une carte architecturale du projet plutôt qu'un tas de fichiers à parcourir un par un, ça change vraiment la façon dont le modèle raisonne. Reste à voir si ça tient sur 500k lignes, mais le concept est là.

OutilsOutil
1 source
ChatGPT : ce prompt révèle comment votre vie sera dans 5 ans
1971Le Big Data 

ChatGPT : ce prompt révèle comment votre vie sera dans 5 ans

Depuis quelques jours, un prompt circule massivement sur les réseaux sociaux et transforme ChatGPT en simulateur de vie personnelle. Le principe : demander au modèle d'OpenAI d'agir comme un "stratège de vie futuriste", puis répondre à une série de questions détaillées sur son quotidien. Sommeil, revenus, niveau de stress, vie sociale, dépendance aux écrans, ambitions professionnelles, l'IA collecte l'ensemble de ces données avant de produire une projection de la vie de l'utilisateur dans cinq ans. Un journaliste de Tom's Guide l'a testé et rapporté un résultat frappant : non pas la réussite brillante fantasmée à la Silicon Valley, mais une existence confortable en apparence, dominée par la surcharge de travail, l'isolement social, la fatigue chronique et un sentiment de stagnation malgré les succès professionnels. Le tout formulé sur un ton ni dramatique ni alarmiste, juste froidement logique. L'effet produit sur les utilisateurs tient à un mécanisme psychologique simple mais puissant : l'IA ne révèle rien de nouveau, elle renvoie simplement aux individus leurs propres contradictions, formulées noir sur blanc par une machine. Quelqu'un qui dort peu, travaille sans relâche et néglige ses liens sociaux n'a pas besoin d'un algorithme pour anticiper les conséquences. Mais voir ce constat écrit de manière structurée et impartiale déclenche quelque chose que la simple conscience intérieure ne suffit pas toujours à provoquer. C'est le même mécanisme qu'une notification de temps d'écran sur smartphone : on sait déjà qu'on y passe trop de temps, mais voir le chiffre précis reste inconfortable. ChatGPT joue ici le rôle d'un miroir statistique, sans jugement et sans rendez-vous. Ce phénomène viral illustre une évolution profonde du rapport des utilisateurs aux intelligences artificielles génératives. Beaucoup ne cherchent plus seulement des réponses pratiques ou de l'aide à la productivité, ils attendent désormais des diagnostics personnels, des validations émotionnelles, voire des électrochocs existentiels. OpenAI n'a rien conçu de spécifique pour cet usage : c'est la flexibilité du modèle, combinée à l'ingéniosité des prompts communautaires, qui ouvre ces nouveaux territoires d'usage. Il faut néanmoins garder une distance critique : ChatGPT ne dispose d'aucune capacité de prédiction réelle et ses projections reposent uniquement sur les informations fournies et des modèles statistiques généraux. Ce que cette tendance révèle surtout, c'est la demande croissante d'outils capables de jouer le rôle de coach, de thérapeute ou de conseiller de vie, un espace que les grandes plateformes d'IA n'ont pas fini d'explorer.

SociétéOpinion
1 source
Memori : une mémoire persistante pour agents LLM
1972MarkTechPost 

Memori : une mémoire persistante pour agents LLM

Memori s'impose comme une couche d'infrastructure mémoire native pour les agents LLM, permettant aux applications d'intelligence artificielle de conserver et d'isoler le contexte utilisateur à travers plusieurs sessions et identités. Un tutoriel publié cette semaine détaille son implémentation concrète dans un environnement Google Colab, en connectant Memori à des clients OpenAI synchrones et asynchrones via le modèle gpt-4o-mini. La bibliothèque, disponible dès la version 3.3.0, s'installe en quelques lignes aux côtés du SDK OpenAI et de Nest AsyncIO. Le principe central repose sur l'enregistrement des clients LLM auprès de Memori, qui intercepte alors automatiquement chaque appel de complétion pour y injecter ou y stocker des informations contextuelles. L'attribution de la mémoire se fait par paire entity\id et process\id : deux paramètres qui définissent à quel utilisateur et à quel rôle d'agent appartient chaque fragment d'information. Ce mécanisme résout un problème fondamental des applications LLM actuelles : l'amnésie entre les sessions. Sans infrastructure mémoire, chaque conversation repart de zéro, forçant l'utilisateur à répéter son contexte à chaque interaction. Avec Memori, un assistant personnel se souvient qu'Alice est allergique aux cacahuètes, aime la cuisine italienne et pratique la randonnée, même si la session a été fermée puis rouverte. Plus crucial encore, le système garantit l'isolation des données entre utilisateurs : les informations de Bob, développeur Rust basé à Berlin et végétarien, ne fuient pas dans la mémoire d'Alice, et inversement. Cette séparation multi-tenant est essentielle pour tout service IA destiné à plusieurs clients ou utilisateurs distincts, que ce soit un chatbot de support client, un assistant professionnel ou une application grand public. Le tutoriel illustre également des cas d'usage plus avancés : réponses en streaming, appels asynchrones et simulation d'un agent de support client multi-tours, autant de scénarios qui testent la robustesse de la couche mémoire dans des conditions proches de la production. Memori propose un niveau gratuit avec limitation de débit, ainsi qu'un accès authentifié via clé API pour les usages intensifs. Cette approche s'inscrit dans une tendance plus large de l'écosystème IA : doter les agents de capacités de persistance et de personnalisation sans que les développeurs aient à construire eux-mêmes des systèmes de stockage et de récupération vectorielle. Des projets comme LangMem, Zep ou MemGPT explorent le même territoire, mais Memori mise sur une intégration transparente via simple enregistrement du client OpenAI, réduisant la friction d'adoption pour les équipes déjà familiarisées avec le SDK standard d'OpenAI.

OutilsOutil
1 source
LightSeek Foundation publie TokenSpeed, moteur d'inférence LLM open source visant TensorRT-LLM pour agents autonomes
1973MarkTechPost 

LightSeek Foundation publie TokenSpeed, moteur d'inférence LLM open source visant TensorRT-LLM pour agents autonomes

La LightSeek Foundation a publié TokenSpeed, un moteur d'inférence pour grands modèles de langage distribué en open source sous licence MIT. Encore en phase de préversion, TokenSpeed est conçu spécifiquement pour les charges de travail dites "agentiques", c'est-à-dire les systèmes d'IA qui enchaînent de multiples appels au modèle pour accomplir des tâches complexes, comme l'écriture ou la révision de code. L'objectif déclaré est d'atteindre des performances comparables à TensorRT-LLM de NVIDIA, tout en restant accessible à l'ensemble de l'écosystème. Le moteur vise à maintenir un débit minimum de 70 tokens par seconde par utilisateur, un seuil qui monte parfois à 200 TPS ou plus, tout en maximisant le nombre de tokens traités par GPU et par minute. L'enjeu dépasse la performance brute. Des outils comme Claude Code d'Anthropic, Codex d'OpenAI ou Cursor fonctionnent sur des contextes qui dépassent régulièrement 50 000 tokens et s'étalent sur des dizaines de tours de conversation, un profil très différent d'un simple chatbot. Or la plupart des benchmarks publics ne rendent pas compte de cette réalité. Lorsqu'un agent de développement logiciel analyse un dépôt entier, génère du code, exécute des tests et itère, chaque milliseconde de latence ajoutée se multiplie à chaque étape. Un moteur d'inférence mal adapté devient rapidement un goulot d'étranglement qui ralentit l'ensemble de la chaîne de production logicielle, et donc, à terme, les équipes d'ingénierie qui en dépendent. L'architecture de TokenSpeed repose sur cinq sous-systèmes complémentaires. Le premier est un mécanisme de parallélisme assisté par compilateur, basé sur le modèle SPMD (Single Program, Multiple Data), qui génère automatiquement les communications entre processus sans que le développeur n'ait à les écrire manuellement. Le planificateur de requêtes sépare strictement le plan de contrôle, implémenté en C++ sous forme de machine à états finis, du plan d'exécution écrit en Python, ce qui permet de détecter les erreurs de gestion du cache KV à la compilation plutôt qu'à l'exécution. Le troisième pilier est une couche de noyaux GPU modulaire et extensible, compatible avec des accélérateurs autres que ceux de NVIDIA, s'appuyant notamment sur l'un des noyaux MLA (Multi-head Latent Attention) les plus rapides disponibles pour les GPU Blackwell. Ce noyau MLA a d'ailleurs déjà été intégré dans vLLM, l'un des moteurs d'inférence open source les plus utilisés dans l'industrie. La fondation LightSeek positionne ainsi TokenSpeed comme une infrastructure commune pour l'ère où les agents IA deviennent le principal vecteur de production de code.

UELa disponibilité d'un moteur d'inférence open source compatible avec des accélérateurs non-NVIDIA pourrait réduire la dépendance des équipes européennes aux solutions propriétaires de NVIDIA.

InfrastructureActu
1 source
Construire un workflow multi-agents pour la modélisation de réseaux biologiques, interactions protéiques, métabolisme et signalisation cellulaire
1974MarkTechPost 

Construire un workflow multi-agents pour la modélisation de réseaux biologiques, interactions protéiques, métabolisme et signalisation cellulaire

Des chercheurs et développeurs en bioinformatique disposent désormais d'un tutoriel détaillé pour construire un pipeline multi-agents capable de modéliser des systèmes biologiques complexes en un seul environnement de calcul unifié. Publié sous forme de notebook Google Colab, ce guide propose d'assembler plusieurs agents spécialisés autour de quatre domaines distincts : l'analyse des réseaux de régulation génique, la prédiction des interactions protéine-protéine, l'optimisation des voies métaboliques et la simulation des cascades de signalisation cellulaire. Chaque agent traite des données synthétiques générées en amont, avec des paramètres contrôlés (14 gènes, 40 protéines, 70 pas de simulation), et un modèle OpenAI GPT-4o-mini joue le rôle d'investigateur principal, synthétisant l'ensemble des résultats en une interprétation biologique cohérente qui relie régulation, métabolisme et signalisation. L'intérêt de cette approche dépasse la simple démonstration technique. En centralisant dans un seul workflow des analyses qui nécessitent habituellement des outils et des équipes séparées, le pipeline réduit la friction entre disciplines et rend la biologie computationnelle reproductible à coût quasi nul. Les chercheurs en génomique, pharmacologie ou biologie synthétique peuvent ainsi prototyper des hypothèses sur des interactions moléculaires sans avoir accès à des données expérimentales réelles, ce qui accélère la phase exploratoire avant les expériences en laboratoire. Le recours à un LLM comme chef d'orchestre final est particulièrement notable : il ne remplace pas l'expertise humaine, mais il agrège des sorties hétérogènes en une narration scientifique structurée, comblant le fossé entre calcul brut et interprétation biologique. Ce type d'infrastructure reflète une tendance de fond dans la bioinformatique computationnelle : l'émergence de systèmes multi-agents où des modules IA spécialisés collaborent plutôt que de concentrer toute la logique dans un seul modèle monolithique. Des entreprises comme Recursion Pharmaceuticals ou Insilico Medicine ont déjà industrialisé des pipelines similaires pour la découverte de médicaments, mais l'accès à ces outils reste souvent réservé à des équipes bien dotées. La mise à disposition d'un tel tutoriel open-source, fondé sur des bibliothèques standard comme NumPy, NetworkX et scikit-learn, démocratise une approche jusque-là réservée aux grands laboratoires. La prochaine étape logique serait d'y intégrer de vraies données omiques, comme des profils d'expression ARN issus de bases publiques telles que GEO ou TCGA, pour transformer ce prototype pédagogique en outil de recherche opérationnel.

RechercheTuto
1 source
Plongée dans le code : UI à base d'agents, UI générative, synchronisation d'état et validation par interruption
1975MarkTechPost 

Plongée dans le code : UI à base d'agents, UI générative, synchronisation d'état et validation par interruption

Un tutoriel récemment publié propose de construire une pile complète d'interfaces utilisateur agentiques (Agentic UI) en Python pur, sans recourir à des frameworks externes. L'implémentation couvre le protocole AG-UI, un flux d'événements composé d'environ 16 types diffusés en temps réel via Server-Sent Events (SSE), parmi lesquels des événements de démarrage et fin de session, de messages texte, d'appels d'outils et de synchronisation d'état. Le tutoriel intègre également A2UI, une couche déclarative permettant de définir des interfaces graphiques sous forme de JSON structuré plutôt que de code exécutable. L'ensemble est connecté à un modèle de langage (GPT-4o-mini d'OpenAI dans les exemples de code) capable de générer des interfaces complètes à partir de descriptions en langage naturel. L'enjeu central de cette approche réside dans la synchronisation entre l'état de l'agent et celui de l'interface utilisateur, assurée via JSON Patch, une norme RFC permettant des mises à jour incrémentales et précises de structures de données. Le tutoriel aborde aussi les flux d'approbation interrompus, un mécanisme qui impose une validation humaine pour les actions critiques avant qu'un agent ne les exécute, principe connu sous le nom de "human-in-the-loop". Pour les développeurs, cette architecture ouvre la voie à des interfaces capables de s'adapter dynamiquement au raisonnement d'un agent IA, sans rechargement ni recompilation manuelle. C'est une rupture avec les interfaces statiques traditionnelles : l'UI devient un artefact vivant, piloté par l'état cognitif du modèle. Cet article s'inscrit dans une effervescence croissante autour des systèmes multi-agents et des protocoles qui leur sont associés. AG-UI émerge comme une tentative de standardisation, à l'image du Model Context Protocol (MCP) d'Anthropic pour la gestion du contexte, ou d'Agent2Agent de Google pour la communication inter-agents. L'objectif commun est de fournir une couche d'interopérabilité entre agents et interfaces, indépendamment du modèle sous-jacent. En construisant cet outillage depuis zéro, le tutoriel cherche à démystifier ces protocoles souvent masqués par des abstractions de haut niveau comme LangGraph ou CrewAI. À mesure que les agents IA passent du laboratoire à la production, la question de leur observabilité et de leur contrôlabilité devient critique, et des ressources pédagogiques de ce type jouent un rôle de formation essentiel pour les ingénieurs qui bâtissent ces systèmes.

OutilsOutil
1 source
Créer un agent d'apprentissage par renforcement pour retrouver des mémoires pertinentes et améliorer les réponses des LLM
1976MarkTechPost 

Créer un agent d'apprentissage par renforcement pour retrouver des mémoires pertinentes et améliorer les réponses des LLM

Des chercheurs ont publié un tutoriel détaillé montrant comment construire un agent d'apprentissage par renforcement capable de récupérer des souvenirs pertinents dans une base de mémoire à long terme, pour améliorer la précision des réponses d'un grand modèle de langage. Le système repose sur une combinaison de plusieurs briques technologiques : les embeddings vectoriels d'OpenAI (modèle text-embedding-3-small), un environnement d'entraînement personnalisé codé avec la bibliothèque Gymnasium, et l'algorithme PPO (Proximal Policy Optimization) de Stable-Baselines3. Le pipeline commence par la génération d'un jeu de données synthétique de "souvenirs" accompagné de requêtes associées, chaque souvenir et chaque requête étant convertis en vecteurs numériques pour permettre un calcul de similarité. L'agent apprend ensuite une politique de sélection, en observant les caractéristiques des candidats mémoire et en choisissant lequel récupérer. La réponse finale est générée par gpt-4o-mini, qui ne dispose que des souvenirs récupérés comme contexte. L'enjeu central de cette approche est de dépasser les limites de la simple recherche par similarité cosinus, qui reste la méthode dominante dans la plupart des systèmes RAG (Retrieval-Augmented Generation) actuels. En entraînant un agent à optimiser ses décisions de récupération via un signal de récompense, le système apprend à distinguer les souvenirs superficiellement proches mais peu utiles des souvenirs véritablement pertinents pour répondre à une question donnée. Pour les applications concrètes, assistants personnels, agents autonomes, systèmes de support client avec historique, cette capacité à mieux cibler l'information pertinente peut significativement améliorer la qualité des réponses sans augmenter la taille du contexte envoyé au modèle. L'évaluation s'appuie elle-même sur un LLM jouant le rôle de juge strict, retournant un score binaire (1.0 ou 0.0) selon que la réponse prédite correspond sémantiquement à la réponse attendue. Cette publication s'inscrit dans un courant de recherche actif qui cherche à doter les LLMs d'une mémoire externe persistante et intelligemment gérée. Les approches RAG classiques encodent et cherchent des documents de façon statique, sans jamais apprendre de leurs erreurs de récupération. L'idée d'utiliser l'apprentissage par renforcement pour optimiser ce processus de sélection est explorée depuis quelques années dans la littérature académique, mais reste peu répandue en production. Ce tutoriel la rend accessible à un large public de praticiens, avec un code reproductible sous Python 3, ce qui pourrait accélérer son adoption dans des projets concrets. La prochaine étape naturelle serait d'appliquer cette méthode à des bases de mémoire réelles, dynamiques et de grande taille, là où la différence entre une bonne et une mauvaise récupération a un impact direct sur la fiabilité de l'agent.

RechercheTuto
1 source
JiuwenClaw ouvre la voie à l'ingénierie de coordination, nouvelle étape dans la maîtrise du génie logiciel
1977MarkTechPost 

JiuwenClaw ouvre la voie à l'ingénierie de coordination, nouvelle étape dans la maîtrise du génie logiciel

La communauté open source openJiuwen a publié une nouvelle version de JiuwenClaw intégrant une fonctionnalité appelée AgentTeam, qui introduit un concept inédit baptisé "Coordination Engineering". L'idée : faire travailler plusieurs agents d'intelligence artificielle ensemble comme une équipe humaine soudée, capable de se répartir les tâches, de communiquer entre eux et de livrer un résultat complexe sans aucune intervention humaine. La démonstration la plus frappante de cette capacité a été réalisée lors de tests internes : le système a produit une présentation technique de 200 diapositives, structurée et logiquement cohérente, en moins de 20 minutes. Pour ce faire, un agent "Leader" a décomposé le sujet en dix axes d'analyse, confié chaque axe à un agent dédié chargé de générer 20 slides, puis fusionné l'ensemble sous une thématique unifiée. Ce type de collaboration multi-agents représente un franchissement de cap significatif dans la conception des systèmes d'IA autonomes. Jusqu'ici, la plupart des architectures d'agents reposaient sur un pilotage humain constant ou sur des pipelines rigides et préprogrammés. Avec AgentTeam, la coordination devient dynamique : le Leader construit l'équipe selon les besoins du projet, peut ajouter ou retirer des membres en cours d'exécution, et chaque agent revendique ses tâches de manière proactive sur un tableau de bord partagé. Les dépendances entre tâches sont gérées automatiquement, et un mécanisme de récupération sur incident prend en charge les pannes sans intervention extérieure. Pour les entreprises cherchant à automatiser des processus de production de contenu, d'analyse ou de développement logiciel, ce niveau d'autonomie organisationnelle pourrait réduire considérablement le besoin de supervision humaine. Ce développement s'inscrit dans une tendance plus large de l'industrie de l'IA vers les systèmes multi-agents, où des acteurs comme OpenAI, Anthropic ou des projets open source concurrents explorent des architectures permettant à plusieurs LLMs de collaborer. JiuwenClaw se distingue en formalisant trois mécanismes techniques précis : une hiérarchie Leader/Teammates avec planification dynamique, un espace de fichiers partagé accessible à tous les agents de l'équipe, et un système de validation à deux niveaux où le Leader doit approuver les plans d'exécution sensibles avant leur mise en oeuvre. Le projet est disponible en open source sur GitHub. La prochaine étape pour l'écosystème sera de déterminer si cette approche tient à plus grande échelle, avec des équipes d'agents plus nombreuses, des tâches plus longues, et des environnements moins contrôlés que les démonstrations actuelles.

OutilsOutil
1 source
1978The Decoder 

Les LLM excellent en code et en maths mais peinent sur les questions triviales, et ce n'est pas contradictoire

Les grands modèles de langage (LLM) affichent des performances remarquables sur les tâches structurées : ils peuvent remanier des bases de code entières en quelques heures, résoudre des problèmes mathématiques complexes et obtenir des scores proches de l'humain sur les benchmarks académiques les plus exigeants. Pourtant, ces mêmes modèles trébuchent régulièrement sur des questions anodines du quotidien, des situations qui ne requièrent aucune expertise technique mais simplement du bon sens et une compréhension souple du langage naturel informel. Ce paradoxe apparent n'en est pas un : il révèle une limite structurelle des architectures actuelles. Les LLM excellent dans les domaines où les données d'entraînement sont abondantes, formatées et codifiées, comme le code source ou les démonstrations mathématiques. En revanche, le langage courant est ambigu, chargé de sous-entendus culturels et de contexte implicite, des dimensions que les modèles reproduisent statistiquement sans les comprendre véritablement. Le fossé entre performance sur benchmark et utilité réelle dans la vie quotidienne reste donc considérable. Ce constat alimente un débat central dans la recherche en IA : les capacités impressionnantes des LLM sur des tâches spécialisées sont-elles le signe d'une intelligence générale émergente, ou simplement le reflet d'une mémorisation sophistiquée de patterns ? Pour les équipes qui développent des assistants grand public chez OpenAI, Google ou Anthropic, combler cet écart entre compétence technique et intelligence conversationnelle ordinaire constitue l'un des défis prioritaires des prochaines années.

LLMsPaper
1 source
Nouvelles options pour équilibrer coût et fiabilité dans l'API Gemini
1979Google AI Blog 

Nouvelles options pour équilibrer coût et fiabilité dans l'API Gemini

Google a annoncé l'introduction de deux nouveaux niveaux d'inférence dans son API Gemini : Flex et Priority. Ces deux paliers visent à offrir aux développeurs un contrôle plus fin sur l'arbitrage entre coût et latence lors de l'appel aux modèles Gemini via l'API. Le niveau Flex est conçu pour les charges de travail tolérantes aux délais, permettant de réduire significativement les coûts en échange d'une latence plus élevée. Le niveau Priority, à l'inverse, garantit des réponses rapides pour les applications temps réel qui nécessitent une fiabilité immédiate, au prix d'un tarif plus élevé. Cette flexibilité permet aux entreprises d'optimiser leurs dépenses selon la criticité de chaque requête. Cette évolution s'inscrit dans la concurrence féroce entre les fournisseurs d'API d'IA générative, où Google affronte OpenAI, Anthropic et d'autres acteurs. La gestion des coûts d'inférence est devenue un enjeu central pour les équipes techniques qui déploient des applications à grande échelle, et proposer des niveaux de service différenciés est désormais une pratique standard dans l'industrie pour attirer aussi bien les startups soucieuses de leurs budgets que les grandes entreprises exigeant des performances maximales.

OutilsActu
1 source
Comment créer des workflows AgentScope prêts pour la production avec agents ReAct, outils personnalisés, débat multi-agents, sorties structurées et pipelines concurrents
1980MarkTechPost 

Comment créer des workflows AgentScope prêts pour la production avec agents ReAct, outils personnalisés, débat multi-agents, sorties structurées et pipelines concurrents

AgentScope, le framework open-source de gestion d'agents IA développé par Alibaba DAMO Academy, dispose désormais d'un tutoriel complet permettant de construire des workflows multi-agents prêts pour la production. Publié début 2026 et conçu pour tourner intégralement dans Google Colab, ce guide pas à pas couvre cinq niveaux de complexité croissante : de l'appel basique à un modèle OpenAI jusqu'à un pipeline concurrent où plusieurs agents spécialistes travaillent en parallèle. La stack technique repose sur Python 3, les bibliothèques agentscope, openai, pydantic et nest_asyncio, avec le modèle gpt-4o-mini comme moteur de raisonnement. Le tutoriel montre comment enregistrer des fonctions Python personnalisées — calcul mathématique, horodatage — dans un Toolkit, inspecter les schémas JSON générés automatiquement, puis connecter ces outils à un agent ReActAgent capable de décider dynamiquement quand les appeler. Ce type de ressource répond à un besoin concret dans l'écosystème des agents IA : la majorité des développeurs savent appeler un LLM, mais peinent à passer à une architecture robuste et modulaire en production. Le tutoriel introduit notamment MsgHub, la primitive d'AgentScope pour orchestrer des débats structurés entre agents — un pattern utile pour la vérification de faits, la critique de code ou la validation de décisions critiques. L'intégration de Pydantic pour forcer des sorties structurées élimine l'un des problèmes les plus fréquents en production : les réponses libres d'un LLM qui cassent le parsing aval. Enfin, le pipeline concurrent — plusieurs spécialistes analysent un problème en parallèle, un synthétiseur agrège leurs conclusions — réduit significativement la latence pour les tâches décomposables, ce qui est central dans les systèmes d'analyse ou de veille automatisée. AgentScope s'inscrit dans une compétition féroce entre frameworks d'orchestration d'agents : LangChain, LlamaIndex, AutoGen de Microsoft ou CrewAI occupent déjà le terrain, mais AgentScope mise sur une API asynchrone native, une gestion mémoire intégrée (InMemoryMemory) et des formateurs de messages spécifiques aux providers (OpenAIChatFormatter, OpenAIMultiAgentFormatter). Le choix de gpt-4o-mini comme modèle de référence dans le tutoriel reflète l'orientation coût/performance qui domine les déploiements réels en 2025-2026. La prochaine étape logique pour ce type de workflow serait l'intégration de mémoire persistante externe et de mécanismes de supervision — deux angles sur lesquels la communauté AgentScope est activement attendue.

💬 AgentScope commence à ressembler à quelque chose de sérieux. Le pattern `MsgHub` pour les débats structurés entre agents, c'est exactement ce qui manque quand tu essaies de faire de la validation critique sans que tout parte en freestyle. Reste à voir si ça tient face à AutoGen ou CrewAI en conditions réelles, parce que sur le papier, tous ces frameworks ont l'air bien jusqu'au premier bug de prod.

OutilsTuto
1 source
Une IA qui rêve la nuit ? Les incroyables secrets du méga-leak d’Anthropic
1981Le Big Data 

Une IA qui rêve la nuit ? Les incroyables secrets du méga-leak d’Anthropic

Le 31 mars 2026, Anthropic a commis l'une des erreurs de déploiement les plus coûteuses de l'histoire récente de l'IA. En publiant la mise à jour 2.1.88 de Claude Code, son agent de programmation autonome, l'entreprise a oublié de retirer un fichier de débogage de 59,8 mégaoctets — un fichier .map qui contenait l'intégralité du code source original de l'outil : plus de 512 000 lignes de TypeScript. En quelques heures, ce code a été partagé plus de 50 000 fois sur GitHub et disséqué par des développeurs du monde entier. Anthropic, qui génère 2,5 milliards de dollars de revenus annuels et dont Claude Code est devenu l'outil de référence dans les équipes techniques des plus grandes entreprises tech, venait d'exposer publiquement la mécanique interne de son produit phare. Ce qui rend cette fuite particulièrement grave n'est pas la compromission de données personnelles ou d'identifiants — il n'y en a pas. C'est la nature même de ce qui a été exposé : l'architecture d'orchestration complète de Claude Code, c'est-à-dire la logique qui lui permet de raisonner, de planifier et de maintenir une cohérence sur des tâches longues. Les concurrents disposent désormais d'un manuel opérationnel détaillé pour construire des agents autonomes comparables. Parmi les découvertes les plus significatives figure un drapeau d'activation nommé KAIROS — référence au concept grec du « moment opportun » — mentionné plus de 150 fois dans le code. Il correspond à un mode « démon autonome » inédit : Claude Code serait capable de continuer à fonctionner en arrière-plan, même terminal fermé, même utilisateur déconnecté. Associée à ce mode, une fonction baptisée autoDream simule une forme de consolidation mémorielle nocturne : lorsque l'utilisateur est inactif, un sous-agent se lance pour trier les observations de la journée, fusionner les informations contradictoires et transformer des déductions vagues en connaissances structurées — un mécanisme directement inspiré du rôle du sommeil paradoxal dans la mémoire humaine. Cette fuite intervient dans un contexte de course effrénée entre les grands laboratoires d'IA pour développer des agents capables d'opérer de façon véritablement autonome sur des horizons temporels longs. Anthropic, OpenAI, Google DeepMind et plusieurs challengers financent massivement cette direction depuis 2024. KAIROS et autoDream montrent qu'Anthropic avait une longueur d'avance significative sur ces capacités — et que ces fonctionnalités n'étaient pas encore annoncées publiquement au moment du leak. La question qui agite désormais la communauté est double : dans quelle mesure des concurrents comme Google ou xAI vont-ils exploiter ce code pour accélérer leurs propres développements, et Anthropic parviendra-t-il à maintenir son avantage malgré la mise à nu involontaire de son infrastructure technique la plus stratégique ?

OutilsOpinion
1 source
Claude Dispatch et la puissance des interfaces
1982One Useful Thing 

Claude Dispatch et la puissance des interfaces

Les modèles d'intelligence artificielle sont aujourd'hui bien plus capables que ce que la plupart des utilisateurs perçoivent — non pas en raison de leurs limites techniques, mais à cause des interfaces qui servent d'intermédiaires. Une étude récente a soumis un groupe de professionnels de la finance à une tâche complexe d'évaluation d'actifs en utilisant GPT-4o, en mesurant leur charge cognitive tour par tour à partir des transcriptions. Résultat : si les participants ont bien enregistré un gain de productivité, celui-ci était largement annulé par la forme même des réponses — des blocs de texte massifs, des digressions non sollicitées, des discussions qui s'emballaient sans jamais se recentrer. Une fois qu'une conversation devenait confuse, elle le restait : le modèle, optimisé pour être utile, amplifiait le désordre introduit par l'utilisateur, et l'utilisateur, débordé, n'avait plus la capacité de réorganiser. Les travailleurs les moins expérimentés — pourtant ceux qui auraient le plus à gagner — étaient les plus pénalisés. Ce constat soulève une question fondamentale pour l'industrie : l'interface est-elle devenue le principal obstacle à l'adoption réelle de l'IA en milieu professionnel ? Pour les développeurs, la réponse existe déjà sous forme d'outils spécialisés. Claude Code d'Anthropic, Codex d'OpenAI ou Antigravity de Google permettent à un agent de travailler de façon autonome pendant des heures sur une base de code, sans que l'utilisateur n'ait besoin de toucher une ligne de code manuellement. Ces environnements supposent toutefois une familiarité avec Python, Git et les terminaux années 1980 — ce qui exclut de facto les 99 % de travailleurs du savoir qui ne sont pas développeurs. Google semble être le laboratoire le plus actif pour explorer d'autres métiers. Stitch propose une toile infinie où l'on décrit une application en langage naturel pour obtenir des écrans interconnectés avec un système de design cohérent. Pomelli cible le marketing : en collant simplement l'URL d'un site, l'outil génère des campagnes social media adaptées à l'identité visuelle de la marque, sans jamais demander de "prompt". NotebookLM, le plus connu des trois, offre un espace structuré pour organiser et interroger des sources d'information hétérogènes. Ces outils restent imparfaits et loin de l'efficacité transformatrice de Claude Code pour les programmeurs, mais ils dessinent une trajectoire : celle d'interfaces construites autour du vocabulaire et des workflows propres à chaque profession, plutôt qu'autour d'une fenêtre de chat généraliste. L'enjeu des prochaines années ne sera pas tant la puissance brute des modèles que la qualité des environnements dans lesquels ils s'intègrent.

OutilsOutil
1 source
Anthropic : entre annonces et Mythos
1983Next INpact 

Anthropic : entre annonces et Mythos

Anthropic, la société américaine d'intelligence artificielle fondée en 2021 par d'anciens cadres d'OpenAI, s'est retrouvée sous les projecteurs pour une raison inattendue : non pas une annonce technologique, mais une bourde de communication. L'entreprise basée à San Francisco a involontairement publié un communiqué de presse accompagné de milliers de documents confidentiels, officiellement en raison d'une « erreur humaine » ayant provoqué une mise en ligne prématurée. L'incident a rapidement circulé dans les médias spécialisés, révélant au passage des éléments liés à un projet baptisé « Mythos », présenté comme une IA de nouvelle génération aux ambitions déclarées « légendaires ». L'affaire illustre une tension croissante autour de la communication d'Anthropic, qui multiplie les annonces à un rythme soutenu — plusieurs dizaines de communiqués rien que pour 2026 — au point que médias, investisseurs et grand public peinent parfois à distinguer l'annonce concrète de l'effet d'annonce. Cette confusion a des conséquences réelles : elle alimente à la fois des espoirs démesurés sur les capacités actuelles de l'IA et des inquiétudes infondées, brouillant le débat public sur une technologie dont les implications sont pourtant très sérieuses. La frontière entre marketing agressif et information factuelle devient de plus en plus difficile à tracer. Anthropic occupe une position particulière dans le paysage de l'IA : concurrente directe d'OpenAI, dont elle est issue, elle se positionne sur le créneau de la sécurité et de la recherche responsable tout en jouant le jeu de la communication grand public avec la même intensité que ses rivaux. La fuite supposément accidentelle de documents autour de Mythos s'inscrit dans un contexte où chaque acteur majeur du secteur cherche à contrôler le récit avant ses annonces officielles. Que l'incident soit véritablement involontaire ou une stratégie de teasing calculée, il confirme qu'Anthropic maîtrise, volontairement ou non, l'art de faire parler d'elle.

BusinessOpinion
1 source
Top 3 : Agence automatisation IA et Agents IA 2026
1984Le Big Data 

Top 3 : Agence automatisation IA et Agents IA 2026

En mars 2026, le site ActuIA a publié un classement des trois meilleures agences d'automatisation par intelligence artificielle et de déploiement d'agents IA à destination des entreprises. Le podium réunit Royal Air Force, Markovate et Stema. En tête, Royal Air Force s'impose comme la référence francophone du secteur grâce à un modèle dit d'« externalisation augmentée » : ses équipes déploient des automatisations complètes via des outils comme n8n, Make, Zapier et Claude, tout en mettant à disposition des profils hybrides combinant expertise humaine et IA pour des postes opérationnels — community management, développement web, rédaction, montage vidéo. L'agence propose également la formation des équipes internes pour garantir une autonomie post-déploiement. En deuxième position, l'américano-canadienne Markovate, implantée à Toronto et San Francisco, se spécialise dans l'IA agentique appliquée au e-commerce : gestion de stock prédictive, tarification dynamique, LLM propriétaires et recherche sémantique pour les grandes enseignes de retail. Stema complète le classement en tant qu'agence polyvalente. Ce type de classement reflète une transformation profonde du marché des services aux entreprises : l'automatisation par IA n'est plus réservée aux grands groupes technologiques, elle devient accessible à des PME et ETI cherchant à optimiser leurs workflows métier sans recruter de data scientists en interne. L'émergence d'agences spécialisées — qui facturent du conseil, de l'intégration et du suivi — crée un nouveau segment de l'industrie IT à forte croissance. Pour les entreprises, l'enjeu est concret : réduire les tâches répétitives, accélérer les cycles de décision et personnaliser l'expérience client à grande échelle, sans refonte complète du système d'information. Ce marché des agences IA s'est structuré rapidement sous l'effet de la démocratisation des API de grands modèles de langage (OpenAI, Anthropic, Mistral) et de la maturité des outils d'orchestration no-code comme Make ou n8n. La demande explose depuis 2023, portée par des entreprises qui ont validé les cas d'usage mais manquent de ressources internes pour déployer. La compétition s'intensifie entre acteurs francophones, qui misent sur la proximité culturelle et la maîtrise réglementaire européenne (RGPD, AI Act), et des agences anglophones à plus fort volume. La prochaine étape probable est la spécialisation sectorielle accrue — santé, finance, industrie — et la montée en puissance des agents IA autonomes capables d'enchaîner des tâches complexes sur plusieurs jours sans intervention humaine.

UERoyal Air Force, agence francophone classée première, cible explicitement les PME et ETI françaises en mettant en avant sa conformité RGPD et AI Act comme avantage concurrentiel.

OutilsOutil
1 source
Agent-Infra publie AIO Sandbox : un environnement tout-en-un pour agents IA avec navigateur, shell, système de fichiers partagé et MCP
1985MarkTechPost 

Agent-Infra publie AIO Sandbox : un environnement tout-en-un pour agents IA avec navigateur, shell, système de fichiers partagé et MCP

Agent-Infra a publié AIO Sandbox, un environnement d'exécution open-source conçu pour les agents IA autonomes. Contrairement aux approches classiques qui nécessitent plusieurs conteneurs distincts — un pour le navigateur, un pour l'interpréteur de code, un pour le shell —, cette solution intègre dans un seul environnement Docker un navigateur Chromium pilotable via le protocole CDP (avec support Playwright), des runtimes Python et Node.js préconfigurés, un terminal Bash, un système de fichiers partagé, ainsi que des instances VSCode Server et Jupyter Notebook pour le débogage. Le projet est disponible sur GitHub et inclut des exemples de déploiement Kubernetes avec gestion des ressources CPU et mémoire. Ce qui rend cette infrastructure concrètement utile, c'est son système de fichiers unifié : un fichier téléchargé via le navigateur est immédiatement accessible au shell et à l'interpréteur Python, sans transfert manuel ni synchronisation entre services. Pour un agent qui doit, par exemple, récupérer un CSV depuis un portail web puis lancer un script de nettoyage de données, cela élimine toute la plomberie intermédiaire. Le projet intègre aussi nativement le Model Context Protocol (MCP), standard ouvert qui normalise la communication entre les LLMs et leurs outils : quatre serveurs MCP sont préconfigurés (navigateur, fichiers, shell, et Markitdown pour convertir des documents en Markdown optimisé pour les modèles). Cette standardisation permet aux développeurs d'exposer les capacités du sandbox à n'importe quel LLM compatible MCP via une API et un SDK. Le lancement d'AIO Sandbox illustre un glissement dans les défis du développement agentique : si les LLMs comme GPT-4o ou Claude sont désormais capables de planifier et générer du code complexe, c'est l'environnement d'exécution — isolé, fiable, outillé — qui devient le vrai goulot d'étranglement. Des acteurs comme Anthropic (avec son computer use), OpenAI (avec ses outils d'exécution de code), ou encore E2B proposent des solutions similaires, mais Agent-Infra parie sur une approche tout-en-un open-source, pensée pour le déploiement en entreprise à haute densité. La compatibilité Kubernetes et l'isolation par conteneur permettent de faire tourner de nombreux agents en parallèle sans qu'ils interfèrent avec le système hôte. Dans un écosystème où les frameworks agentiques comme LangChain, AutoGen ou CrewAI se multiplient, disposer d'une couche d'exécution standardisée et robuste devient un prérequis pour passer des prototypes aux déploiements en production.

OutilsOpinion
1 source
Comment construire des agents IA de cybersécurité avancés avec CAI : outils, garde-fous, transferts et workflows multi-agents
1986MarkTechPost 

Comment construire des agents IA de cybersécurité avancés avec CAI : outils, garde-fous, transferts et workflows multi-agents

CAI (Cybersecurity AI Framework) est un framework Python open source conçu pour construire des agents d'intelligence artificielle spécialisés en cybersécurité. Un tutoriel détaillé publié récemment démontre, étape par étape dans Google Colab, comment exploiter CAI pour créer des pipelines d'analyse de sécurité complets — depuis un agent basique jusqu'à des architectures multi-agents capables de raisonner, déléguer des tâches, valider des entrées et répondre en temps réel via streaming. Le framework s'installe en une commande (pip install cai-framework), s'appuie sur des modèles compatibles OpenAI comme GPT-4o mini, et expose des classes Python natives — Agent, Runner, function_tool, handoff — pour assembler des workflows de sécurité structurés sans infrastructure complexe. Ce que CAI change concrètement, c'est la capacité à transformer des fonctions Python ordinaires en outils d'analyse que l'agent peut invoquer de manière autonome : vérification de réputation d'adresses IP, simulation de scan de ports style nmap, orchestration de pipelines CTF (Capture The Flag), ou gestion de contexte multi-tours lors d'un incident. Les guardrails d'entrée permettent de filtrer les requêtes hors périmètre avant qu'elles n'atteignent le modèle, réduisant le bruit et les hallucinations. Les handoffs entre agents spécialisés — un agent réseau, un agent forensic, un agent de remédiation — permettent de simuler une équipe SOC entière dans un seul workflow automatisé. Pour les professionnels de la sécurité, cela signifie qu'une grande partie du triage et de l'analyse de premier niveau devient automatisable avec quelques dizaines de lignes de code. CAI s'inscrit dans une tendance plus large qui voit les frameworks d'agents IA (LangChain, AutoGen, OpenAI Agents SDK) être déclinés pour des domaines métier spécifiques. La cybersécurité est un terrain particulièrement fertile : les analystes SOC font face à des volumes d'alertes croissants, les pénétrateurs répètent des tâches de reconnaissance standardisées, et les CTF constituent un terrain d'entraînement idéal pour des agents capables de raisonnement multi-étapes. Le fait que CAI soit compatible avec n'importe quel modèle exposant une API OpenAI — y compris des modèles locaux via OpenRouter ou Ollama — le rend accessible sans dépendance à un fournisseur cloud unique. La prochaine étape naturelle pour le framework serait l'intégration avec des outils réels (Shodan, VirusTotal, SIEM) et des environnements de sandboxing pour tester des exploits sans risque, ce qui en ferait un copilote crédible pour les équipes de sécurité offensives et défensives.

OutilsOutil
1 source
Guide complet du pipeline d'agents nanobot : outils, mémoire, sous-agents et planification cron
1987MarkTechPost 

Guide complet du pipeline d'agents nanobot : outils, mémoire, sous-agents et planification cron

Le framework nanobot, développé par le laboratoire HKUDS de l'Université de Hong Kong, s'impose comme l'une des solutions les plus légères pour construire des agents IA personnels complets. Rédigé en environ 4 000 lignes de Python, il embarque l'ensemble du pipeline agent : boucle de raisonnement, exécution d'outils, persistance mémoire, chargement de compétences (skills), gestion de sessions, délégation à des sous-agents et planification via cron. Un tutoriel publié récemment propose d'en reconstruire chaque sous-système à la main, en utilisant le modèle gpt-4o-mini d'OpenAI comme moteur LLM, afin de comprendre précisément leur fonctionnement plutôt que de simplement les utiliser en boîte noire. Le tutoriel progresse étape par étape : depuis une simple boucle d'appel d'outil jusqu'à un pipeline de recherche multi-étapes capable de lire et d'écrire des fichiers, de stocker des mémoires à long terme, et de déléguer des tâches à des agents parallèles fonctionnant en arrière-plan. Ce type de ressource pédagogique a une valeur pratique immédiate pour les développeurs qui souhaitent construire des agents IA sans dépendre de frameworks lourds comme LangChain ou AutoGen, dont la complexité et l'opacité sont souvent citées comme obstacles à la maintenance et à la compréhension. Nanobot mise sur la lisibilité du code source pour permettre aux équipes techniques de personnaliser chaque composant : outils sur mesure, architectures d'agents propres, logiques de scheduling adaptées. Pour un développeur solo ou une petite équipe, pouvoir déployer un agent personnel — capable d'effectuer des recherches, de mémoriser des contextes entre sessions et de lancer des tâches planifiées — en s'appuyant sur moins de 5 000 lignes de code auditables représente un changement d'échelle significatif. Nanobot s'inscrit dans une tendance plus large de miniaturisation des frameworks agentiques, portée par la maturité croissante des API LLM et la volonté de réduire la dette technique dans les projets IA. Alors que les grandes plateformes comme OpenAI ou Anthropic poussent leurs propres solutions d'orchestration, des projets open source légers comme nanobot, smolagents (HuggingFace) ou DSPy cherchent à garder le contrôle dans les mains des développeurs. HKUDS, connu pour ses travaux sur les systèmes de recommandation et les graphes de connaissances, confirme ici une diversification vers l'ingénierie agentique appliquée. Les prochaines évolutions du framework pourraient intégrer une compatibilité multi-modèles élargie, notamment vers les LLM open source via Ollama, et un système de partage de skills entre utilisateurs.

OutilsTuto
1 source
STADLER réinvente le travail intellectuel dans une entreprise vieille de 230 ans
1988OpenAI Blog 

STADLER réinvente le travail intellectuel dans une entreprise vieille de 230 ans

STADLER, entreprise vieille de 230 ans spécialisée dans les systèmes de tri et de gestion des déchets, a déployé ChatGPT auprès de 650 collaborateurs pour transformer leur façon de traiter l'information et de produire du contenu. L'initiative, menée en partenariat avec OpenAI, vise à automatiser les tâches répétitives à forte valeur cognitive — rédaction de documents, synthèse de rapports, recherche interne — afin de libérer du temps pour des activités à plus forte valeur ajoutée. Des gains de productivité mesurables ont déjà été observés dans plusieurs départements depuis le déploiement. L'enjeu est de taille pour une entreprise industrielle traditionnelle : intégrer des outils d'IA générative dans des processus métiers souvent rigides constitue un changement culturel autant que technologique. Pour les 650 employés concernés, cela représente une nouvelle façon de travailler au quotidien, avec des assistants IA capables de rédiger, résumer et structurer l'information en quelques secondes là où il fallait auparavant plusieurs heures. Le cas STADLER illustre une tendance de fond : les entreprises industrielles centenaires, longtemps considérées comme réfractaires à l'innovation numérique rapide, accélèrent désormais leur adoption de l'IA générative. OpenAI multiplie ce type de partenariats avec des entreprises B2B pour ancrer ChatGPT Enterprise dans les flux de travail réels, face à la concurrence de Microsoft Copilot et Google Gemini for Workspace. La prochaine étape pour STADLER sera probablement d'étendre ces usages à l'ensemble de la chaîne de valeur, de la conception à la relation client.

UEUne entreprise industrielle européenne de 650 salariés adopte ChatGPT Enterprise, illustrant l'accélération de l'IA générative dans le tissu industriel traditionnel du continent.

OutilsActu
1 source
Le fondateur d’Apple donne son avis sur l’IA, et il n’y va pas de main morte
1989Le Big Data 

Le fondateur d’Apple donne son avis sur l’IA, et il n’y va pas de main morte

Steve Wozniak, cofondateur d'Apple et figure emblématique de la Silicon Valley, a exprimé dans une interview accordée à Fox Business une franche désillusion vis-à-vis de l'intelligence artificielle générative. Il affirme être « déçu souvent » par les outils actuels et admet les utiliser rarement. Ses deux critiques principales : l'incapacité des IA à reproduire l'émotion humaine, et un problème de fiabilité persistant. Quand il interroge un système comme ChatGPT, il obtient des réponses longues, structurées et factuelles — là où un humain raconterait, contextualiserait, partagerait une expérience subjective. Cette dimension émotionnelle et intentionnelle lui semble fondamentalement absente des modèles actuels. Sur la fiabilité, il est tout aussi catégorique : « Je veux un contenu fiable à chaque fois », une exigence que les LLM actuels ne remplissent pas, capables de produire des réponses convaincantes mais parfois fausses, sans signaler leurs propres limites. Ces critiques ont un poids particulier dans le contexte actuel, où l'IA s'immisce dans des domaines à fort enjeu — éducation, santé, information — et où la confiance des utilisateurs est un enjeu central. Si les modèles de langage sont conçus pour optimiser pertinence et clarté, ils ne garantissent pas une authenticité ni une constance qui permettraient de les ériger en sources d'autorité. Pour Wozniak, tant que cette fiabilité n'est pas acquise, l'IA reste un outil d'assistance, pas un substitut au jugement humain. C'est une préoccupation partagée par de nombreux acteurs du secteur, notamment sur les risques de désinformation ou de décisions automatisées mal fondées dans des contextes critiques. Cette prise de position intervient dans un moment de tension stratégique pour Apple elle-même. L'entreprise a lancé en 2024 Apple Intelligence avec l'ambition affichée de rattraper OpenAI, Google et Microsoft sur le terrain de l'IA, mais plusieurs fonctionnalités annoncées tardent à être déployées, signe d'une progression prudente. Tim Cook, lui, décrit l'IA comme « profondément enrichissante et potentiellement très positive » pour l'expérience utilisateur — un contraste saisissant avec le scepticisme de son cofondateur historique, qui n'a plus de rôle opérationnel dans l'entreprise. Wozniak s'inscrit ainsi dans une tradition de voix critiques venues de l'intérieur même de la tech — des figures comme Geoffrey Hinton ou Yann LeCun qui, chacun à leur manière, ont formulé des réserves profondes sur la trajectoire actuelle de l'IA. Son discours rappelle que l'enthousiasme industriel autour de ces technologies ne fait pas l'unanimité, y compris parmi ceux qui ont bâti le monde numérique d'aujourd'hui.

SociétéOpinion
1 source
Grâce à Lyria 3 Pro, l’IA Gemini de Google peut maintenant créer de la musique de 3 minutes
1990Presse-citron 

Grâce à Lyria 3 Pro, l’IA Gemini de Google peut maintenant créer de la musique de 3 minutes

Google a dévoilé Lyria 3 Pro, une version améliorée de son modèle de génération musicale par intelligence artificielle, quelques semaines seulement après le lancement de Lyria 3 en février 2026. Cette nouvelle itération est intégrée directement dans Gemini et réservée aux abonnés de la formule payante. Sa capacité principale : générer des morceaux de musique pouvant atteindre trois minutes, une durée bien supérieure à ce que proposaient les versions précédentes. Cette avancée est significative pour les créateurs de contenu, les musiciens amateurs et les professionnels cherchant à produire rapidement de la musique originale. Passer de courts extraits à des compositions de trois minutes ouvre la porte à des usages concrets : bandes originales, jingles, musiques d'ambiance pour vidéos ou podcasts. La qualité et la durée combinées font de Lyria 3 Pro un outil potentiellement compétitif face aux solutions dédiées comme Suno ou Udio. Google s'inscrit dans une course effrénée à la génération audio par IA, un segment en pleine expansion où OpenAI, Meta et plusieurs startups investissent massivement. En ancrant Lyria 3 Pro dans l'écosystème Gemini, Google mise sur la fidélisation de ses abonnés premium tout en consolidant sa position dans la création de contenu multimodal, après ses ambitions affichées dans l'image et la vidéo avec Imagen et Veo.

LLMsActu
1 source
Notre approche du Model Spec
1991OpenAI Blog 

Notre approche du Model Spec

OpenAI a publié une description détaillée de son approche du "Model Spec", un document cadre qui définit les règles de comportement de ses modèles d'IA. Ce texte établit une hiérarchie de priorités : la sécurité large avant tout, puis les principes éthiques, les règles internes d'OpenAI, et enfin l'utilité pour l'utilisateur. Ce cadre devient un enjeu central à mesure que les modèles gagnent en autonomie. En rendant ces règles publiques, OpenAI cherche à instaurer une forme de responsabilité partagée — les opérateurs (développeurs) et les utilisateurs peuvent comprendre et anticiper les limites imposées aux modèles. Cela répond aussi aux critiques sur le manque de transparence des grandes entreprises d'IA. Le Model Spec s'inscrit dans une tendance plus large : face à la montée des agents autonomes, les labos d'IA tentent de formaliser des garde-fous avant que ces systèmes ne prennent des décisions à fort impact.

SécuritéActu
1 source
J'ai testé GPT-5.4 Thinking, et les réponses étaient vraiment bonnes, mais elles ne correspondaient pas toujours à ce que j'avais demandé
1992ZDNET FR 

J'ai testé GPT-5.4 Thinking, et les réponses étaient vraiment bonnes, mais elles ne correspondaient pas toujours à ce que j'avais demandé

L'auteur a testé GPT-5.4 Thinking et reconnaît la qualité des réponses, mais soulève une préoccupation majeure : le modèle ne suit pas toujours les instructions données. Cette observation le rend sceptique face aux affirmations d'OpenAI sur les capacités professionnelles du modèle.

LLMsOpinion
1 source
Sous-titre automatique avec Whisper : Tutoriel étape par étape - mars 2026
1993Le Big Data 

Sous-titre automatique avec Whisper : Tutoriel étape par étape - mars 2026

Whisper, le modèle de reconnaissance vocale d'OpenAI, permet de générer des sous-titres automatiques en local, gratuitement et sans dépendance à un service cloud. Disponible en plusieurs tailles selon la puissance GPU, il supporte des dizaines de langues et effectue des traductions vers l'anglais. Son installation nécessite Python et FFmpeg, mais offre une confidentialité totale et une utilisation illimitée une fois configuré.

OutilsTuto
1 source
On ne s’y attendait pas : voici la grosse offensive de Xiaomi contre Gemini et GPT
1994Frandroid 

On ne s’y attendait pas : voici la grosse offensive de Xiaomi contre Gemini et GPT

Xiaomi lance MiMo-V2-Pro, un nouveau modèle d'IA positionné comme concurrent direct de Gemini (Google) et GPT (OpenAI). Cette offensive marque l'entrée ambitieuse du constructeur chinois dans la course aux grands modèles de langage. L'article ne précise pas encore les capacités techniques ni les benchmarks du modèle.

LLMsActu
1 source
GitAgent : le Docker des agents IA qui résout enfin la fragmentation entre LangChain, AutoGen et Claude Code
1995MarkTechPost 

GitAgent : le Docker des agents IA qui résout enfin la fragmentation entre LangChain, AutoGen et Claude Code

GitAgent est un outil CLI open-source et une spécification qui introduit un format universel et agnostique de framework pour le développement d'agents IA, permettant de découpler la définition d'un agent de son environnement d'exécution. Il s'attaque à la fragmentation actuelle entre les principaux frameworks — LangChain, AutoGen, CrewAI, OpenAI Assistants et Claude Code — en structurant un agent comme un répertoire Git composé de fichiers clés : agent.yaml (manifest), SOUL.md (personnalité), DUTIES.md (responsabilités), ainsi que des dossiers skills/, tools/, rules/ et memory/. Git sert de couche de supervision native : chaque évolution de l'état interne de l'agent (mémoire, compétences) est traitée comme un changement de code, garantissant traçabilité et versioning complet.

OutilsOutil
1 source
Implémentation d'un système LLM avec gestion de l'incertitude, estimation de confiance, auto-évaluation et recherche web automatique
1996MarkTechPost 

Implémentation d'un système LLM avec gestion de l'incertitude, estimation de confiance, auto-évaluation et recherche web automatique

Ce tutoriel présente la construction d'un système LLM conscient de l'incertitude, combinant estimation de confiance, auto-évaluation et recherche web automatique. Le pipeline en trois étapes génère d'abord une réponse avec un score de confiance, puis effectue une auto-critique, et déclenche automatiquement une recherche web en temps réel si la confiance est inférieure à 0,55. Le framework utilise GPT-4o-mini avec l'API OpenAI et la bibliothèque DuckDuckGo Search (ddgs) pour produire des réponses plus fiables et transparentes.

OutilsTuto
1 source
ChatGPT : la version gratuite passe à GPT-5.4 mini, voici ce que ça change
199701net 

ChatGPT : la version gratuite passe à GPT-5.4 mini, voici ce que ça change

OpenAI a lancé GPT-5.4 mini et nano, deux nouveaux modèles axés sur la légèreté tout en maintenant de bonnes performances. La version gratuite de ChatGPT passe désormais à GPT-5.4 mini, offrant aux utilisateurs sans abonnement un accès à un modèle plus récent et plus efficace.

LLMsActu
1 source
Amis développeurs, Sam Altman vous dit « merci »
1998Numerama 

Amis développeurs, Sam Altman vous dit « merci »

Sam Altman, PDG d'OpenAI, a publié un message de gratitude envers les développeurs ayant écrit du code "caractère par caractère". Ce tweet a provoqué une vague de colère dans le secteur tech, déjà en pleine turbulence sociale.

SociétéOpinion
1 source
Gouvernance IA d'entreprise : mise en œuvre avec OpenClaw Gateway, workflows d'approbation et exécution d'agents auditables
1999MarkTechPost 

Gouvernance IA d'entreprise : mise en œuvre avec OpenClaw Gateway, workflows d'approbation et exécution d'agents auditables

Ce tutoriel présente la construction d'un système de gouvernance IA d'entreprise en utilisant OpenClaw et Python. Le système combine une passerelle OpenClaw Gateway avec une couche de gouvernance Python qui classifie les requêtes selon leur niveau de risque, applique des politiques d'approbation, et achemine les tâches vers un agent IA (basé sur GPT-4.1 mini d'OpenAI). L'objectif est de permettre aux organisations de déployer des systèmes IA autonomes tout en conservant visibilité, traçabilité et contrôle opérationnel.

OutilsOutil
1 source
Vous pouvez utiliser Shazam directement dans ChatGPT
200001net 

Vous pouvez utiliser Shazam directement dans ChatGPT

OpenAI intègre désormais Shazam directement dans l'interface de ChatGPT, permettant aux utilisateurs d'identifier des morceaux de musique sans quitter le chatbot. Cette addition s'inscrit dans la stratégie d'OpenAI d'enrichir ChatGPT par l'intégration d'applications tierces.

OutilsOutil
1 source