Aller au contenu principal

Dossier Gemini — page 14

702 articles · page 14 sur 15

Gemini, la famille de modèles de Google DeepMind : sorties Flash et Pro, intégration Apple/Siri, agents Robotics ER, capacités vocales temps réel.

10 plateformes IA open source sans code pour créer des applications LLM, des systèmes RAG et des agents IA
651MarkTechPost OutilsOutil

10 plateformes IA open source sans code pour créer des applications LLM, des systèmes RAG et des agents IA

Un nouveau panorama recense dix plateformes open source qui permettent de construire des applications LLM, des systèmes RAG et des agents IA sans écrire de code d'orchestration à la main. Parmi les projets phares figure AutoAgent, développé par le Data Intelligence Lab de l'Université de Hong Kong, disponible sous licence MIT et documenté dans un article arXiv (2502.05957). Il suffit de décrire un objectif en langage naturel pour que le système génère lui-même outils, agents et flux de travail multi-agents, via un éditeur d'agents, un éditeur de workflows et un mode assistant de recherche prêt à l'emploi, compatible avec DeepSeek, Grok ou Gemini et déployable via Docker. Autre projet cité, AnythingLLM de Mintplex Labs, soutenu par Y Combinator, propose une plateforme tout-en-un auto-hébergée pour le RAG, les agents et le dialogue documentaire, sous forme d'application de bureau ou de conteneur Docker, avec plus de 30 fournisseurs de LLM compatibles et plusieurs bases vectorielles, le tout sous licence MIT. LangChain a de son côté lancé l'Open Agent Platform (OAP), une interface web sans code pour créer et gérer des agents LangGraph, avec authentification intégrée via Supabase par défaut et connexion aux serveurs MCP. Enfin, Sim Studio, sous licence Apache 2.0 et également soutenu par YC, mise sur un canevas visuel façon Figma où l'on assemble des blocs (Start, Agent, Function, API, Router, Loop) pour composer des pipelines, avec un copilote IA et une compatibilité annoncée avec plus de 1 000 outils. Cette vague d'outils change concrètement la façon dont les équipes techniques et non techniques abordent le développement d'applications d'intelligence artificielle. Là où la construction d'un agent ou d'un système de recherche augmentée nécessitait auparavant des compétences en ingénierie logicielle et l'assemblage manuel de bibliothèques d'orchestration, ces plateformes permettent de prototyper en quelques minutes via des interfaces visuelles ou de simples instructions en anglais courant. L'auto-hébergement, revendiqué par la plupart de ces projets, répond aussi à une préoccupation croissante des entreprises et administrations sur la souveraineté des données, en évitant de faire transiter des documents sensibles par des services tiers hébergés dans le cloud. Les licences permissives, MIT ou Apache 2.0, facilitent en outre l'usage commercial et les déploiements multi-clients sans contrainte juridique lourde. Ce mouvement s'inscrit dans la maturation rapide de l'écosystème des agents IA depuis 2024, où la démocratisation des outils suit celle des modèles eux-mêmes. Des acteurs comme LangChain, déjà installés dans l'écosystème des développeurs, ajoutent désormais une couche graphique à leurs frameworks existants, tandis que des startups plus jeunes soutenues par Y Combinator, comme Sim ou AnythingLLM, misent sur la simplicité d'usage pour capter des utilisateurs non spécialistes. La suite logique de cette tendance serait une consolidation autour de standards communs comme le protocole MCP, déjà adopté par plusieurs de ces plateformes, afin d'assurer l'interopérabilité entre agents et outils tiers.

UEL'auto-hébergement de ces plateformes peut intéresser les entreprises et administrations françaises soucieuses de souveraineté des données, sans impact réglementaire direct.

1 source
Cette appli IA clone votre voix et transforme votre galerie en Reels prêt à être poster
652Le Big Data 

Cette appli IA clone votre voix et transforme votre galerie en Reels prêt à être poster

Reelful, une nouvelle application disponible pour l'instant uniquement sur iOS, permet de transformer automatiquement les photos et vidéos stockées dans la pellicule d'un smartphone en reels prêts à être publiés sur les réseaux sociaux. Le fonctionnement repose sur l'intelligence artificielle : l'utilisateur décrit en quelques mots l'histoire qu'il souhaite raconter (un voyage, une fête, la présentation d'un produit), puis enregistre une trentaine de secondes de sa voix. L'application crée alors une version synthétique de cette voix, qui servira de narration tout au long de la vidéo. Une fois les photos et vidéos sélectionnées, Reelful se charge d'organiser les séquences, de rédiger le script, d'ajouter la voix off, de choisir une musique, d'intégrer des sous-titres et des effets sonores. L'outil peut même animer des images fixes, par exemple transformer une photo d'une personne tenant une bière en une courte séquence où elle porte le verre à sa bouche. Des versions Android et web sont annoncées pour plus tard. Côté tarifs, l'application fonctionne par crédits ou par abonnement : les packs démarrent à 15 dollars pour cinq vidéos, jusqu'à 90 dollars pour trente-trois vidéos, tandis que les abonnements mensuels vont de 25 dollars pour dix vidéos (formule Créateur) à 100 dollars pour soixante vidéos (formule Studio), en passant par une offre Pro à 50 dollars pour vingt-cinq vidéos. Cette application illustre un basculement déjà amorcé par des modèles comme Gemini Omni Flash de Google : le montage vidéo, longtemps un métier à part entière nécessitant des compétences techniques et du temps, devient une simple fonctionnalité accessible en quelques clics. Pour les millions d'utilisateurs qui accumulent des souvenirs personnels sans jamais les partager faute de temps ou de savoir-faire, cela supprime la barrière technique entre un contenu brut et une publication soignée. Pour les créateurs de contenu réguliers, les formules d'abonnement offrent une alternative potentiellement moins coûteuse que des logiciels de montage professionnels ou que l'embauche de monteurs freelance, tout en garantissant une production rapide et standardisée. Cette évolution s'inscrit dans une tendance plus large de l'IA générative appliquée à la vidéo, où la création de contenu passe d'un savoir-faire spécialisé à un service automatisé accessible au grand public. Les enjeux qui en découlent touchent à la fois l'avenir des métiers du montage vidéo, la qualité et l'authenticité des contenus diffusés sur les réseaux sociaux, ainsi que les questions de propriété liée aux voix synthétiques générées à partir d'un simple enregistrement de trente secondes. La concurrence entre grandes plateformes technologiques et applications spécialisées comme Reelful devrait s'intensifier à mesure que ces outils gagnent en popularité.

CréationOutil
1 source
J'ai un pressentiment
653Ben's Bites 

J'ai un pressentiment

Thinking Machines, la startup fondée par l'ancienne directrice technique d'OpenAI Mira Murati, a lancé Inkling, son premier modèle en poids ouverts (open-weights). Le modèle dispose d'une fenêtre de contexte d'un million de tokens et fonctionne sur trois modalités : texte, image et audio. Il reste toutefois loin derrière les meilleurs modèles ouverts du marché, dont la plupart proviennent aujourd'hui de laboratoires chinois, à l'image de GLM-5.2, considéré comme l'un des modèles open source les plus performants actuellement, même s'il ne gère pas encore les images en entrée. Inkling est disponible sur Tinker, la plateforme de fine-tuning de Thinking Machines, permettant aux développeurs de créer des versions personnalisées adaptées à des cas d'usage spécifiques. Par ailleurs, OpenAI a révélé l'existence de GPT-Red, un modèle interne conçu pour attaquer ses propres modèles afin de détecter les instructions cachées capables de les détourner ; cet outil a servi à renforcer la sécurité de GPT-5.6 Sol lors de son entraînement. Google a aussi mis à jour Gemini Spark, son concurrent d'OpenClaw, qui peut désormais éditer des documents Google Docs, lire les commentaires dans Sheets et Slides, et traiter plusieurs sources en parallèle, le tout 50% plus rapidement qu'auparavant. Ces annonces illustrent une bataille de plus en plus intense autour des modèles ouverts, un segment où de nombreuses startups délaissent progressivement les modèles propriétaires les plus puissants au profit de versions auto-hébergées ou affinées de modèles comme GLM-5.2, pour des raisons de coûts et de contrôle. Le fait qu'Inkling arrive loin derrière l'offre chinoise souligne à quel point les laboratoires occidentaux peinent à rivaliser sur ce terrain précis. Du côté de la sécurité, l'existence de GPT-Red témoigne d'une prise de conscience croissante des risques de manipulation par instructions cachées, un sujet d'autant plus sensible qu'un incident récent a montré qu'un prompt dissimulé avait réussi à faire fuiter par Claude des noms, employeurs et réponses à des questions de sécurité issus de sa mémoire. Ce climat de vigilance accrue rejoint les propos tenus par Demis Hassabis, directeur général de DeepMind, qui estime que l'intelligence artificielle générale (AGI) est probablement encore à quelques années. Il appelle à la création d'un organisme de normalisation dirigé par les États-Unis pour tester les modèles les plus avancés avant leur déploiement commercial, avec un partage volontaire des modèles jusqu'à 30 jours avant leur sortie pour évaluer les risques liés à la cybersécurité, aux menaces biologiques et aux comportements trompeurs. Cette proposition, pour l'instant sur une base volontaire mais avec la possibilité d'une approbation de déploiement obligatoire à terme, s'inscrit dans un contexte où même les outils grand public suscitent la controverse : xAI a dû rendre open source son assistant de code Grok Build après que des utilisateurs ont découvert que l'outil envoyait leur code vers ses serveurs par défaut.

💬 Le vrai signal, c'est pas Inkling, c'est son classement : il arrive loin derrière GLM-5.2, un modèle chinois. Une startup fondée par l'ex-CTO d'OpenAI qui sort son premier modèle ouvert et se fait doubler comme ça, ça en dit long sur qui mène vraiment la course à l'open source aujourd'hui. Le million de tokens de contexte et les trois modalités, c'est solide sur le papier, mais la hiérarchie du open-weights s'écrit clairement à Pékin, pas à San Francisco.

LLMsActu
1 source
Linus Torvalds s’agace une nouvelle fois sur l’IA, cette fois pour la défendre
654Next INpact 

Linus Torvalds s’agace une nouvelle fois sur l’IA, cette fois pour la défendre

Linus Torvalds est de nouveau intervenu dans le débat sur l'intelligence artificielle au sein du noyau Linux, mais cette fois pour défendre son usage plutôt que pour critiquer sa qualité. Le différend porte sur Sashiko, un bot de relecture automatisée de patches développé par Roman Gushchin, ingénieur senior chez Google, et annoncé publiquement le 17 mars 2026 sur la liste de diffusion du noyau. Ce service, écrit en Rust et fonctionnant principalement avec le modèle Gemini 3.1 Pro fourni par Google, surveille en continu les soumissions de code sur plusieurs listes de diffusion, dont celle du projet Rust for Linux, et publie automatiquement ses commentaires. Selon les propres mesures de Gushchin, non vérifiées de façon indépendante, Sashiko repère environ 53 % des bugs finalement corrigés sur un échantillon de 1 000 commits récents. Le contributeur historique Laurent Pinchart s'oppose à l'envoi direct de ces relectures aux développeurs, s'appuyant sur des recommandations publiées le 18 juin 2026 par la Software Freedom Conservancy, qui demandent de respecter le choix des contributeurs refusant l'IA. Gushchin rétorque qu'un filtrage humain systématique annulerait l'intérêt du gain de temps promis par l'outil. Cette querelle dépasse le cas d'un simple bot : elle pose la question de la place que l'IA générative peut occuper dans la maintenance d'un projet aussi critique que le noyau Linux, socle logiciel de la majorité des serveurs, smartphones et objets connectés dans le monde. Si Torvalds valide l'usage de Sashiko, cela ouvre la voie à une automatisation accrue de la revue de code sur d'autres projets open source majeurs, avec à la clé des gains de productivité pour des mainteneurs souvent débordés. Mais cela ravive aussi les craintes d'un afflux de contributions ou de commentaires de mauvaise qualité générés par IA, un phénomène déjà redouté sous le terme de « slop » dans plusieurs communautés de développeurs. Le contexte est celui d'un Torvalds coutumier des prises de position tranchées, qui avait déjà critiqué par le passé les rapports de bugs générés par des LLM peu fiables. Il affirme désormais sans détour que « Linux n'est pas un projet anti-IA » et que les mécontents peuvent, selon la logique même de l'open source, forker le projet. Il invite aussi les critiques à reconnaître que l'erreur humaine n'a rien d'exceptionnel, et rappelle que l'aspect communautaire du logiciel libre reste secondaire par rapport à l'objectif technique du projet, financé en l'occurrence par l'infrastructure et la puissance de calcul mises à disposition par Google.

OutilsOutil
1 source
5 tendances qui ont marqué l'AI Engineering au World's Fair 2026
655Latent Space 

5 tendances qui ont marqué l'AI Engineering au World's Fair 2026

Le salon AI Engineer World's Fair 2026 a confirmé la maturation rapide de l'ingénierie IA, trois ans après que swyx (Shawn Wang) a inventé le terme "AI engineer" en juin 2023, à une époque où l'on parlait encore de "prompt engineering". L'édition 2026 s'est distinguée par cinq grandes tendances plutôt que par des annonces isolées. La première, et la plus marquante, est le glissement du focus des agents eux-mêmes vers les systèmes qui les entourent. Lilian Weng, ancienne chercheuse d'OpenAI et désormais cofondatrice de Thinking Machines Lab, illustre ce basculement entre son article de 2023, "LLM Powered Autonomous Agents" (qui citait AutoGPT, BabyAGI et GPT-Engineer comme exemples prometteurs), et son nouvel essai 2026, "Harness Engineering for Self-Improvement", centré sur le "harnais" gérant workflows, contexte, permissions, évaluation et amélioration continue. Signe de ce virage, AutoGPT n'a quasiment pas été mentionné cette année, les discussions portant plutôt sur Claude Code, Codex, Gemini CLI, Cursor et Warp. Lors du keynote OpenAI du deuxième jour, Romain Huet a résumé l'ambiance en affirmant que "les AI engineers dévorent le monde", tandis que Thariq Shihipar, d'Anthropic, a comparé le nouveau modèle Claude Fable à un système organique : "les modèles se cultivent, ils ne se conçoivent pas", évoquant une progression de capacités "en pics" difficile à anticiper. La prochaine édition d'AI Engineer se tiendra à New York du 12 au 14 octobre 2026, avec un accent particulier sur l'IA dans la finance. Cette évolution compte parce qu'elle acte la fin du fantasme d'agents totalement autonomes, popularisé en 2023 par le battage autour d'AutoGPT. L'industrie a appris que l'autonomie complète des agents n'est ni fiable ni même souhaitable à grande échelle : les entreprises présentes au salon ont positionné les agents comme des outils augmentant le travail des ingénieurs, pas comme des remplaçants. Pour les équipes techniques, cela signifie investir moins dans la sophistication du prompt ou du modèle brut, et davantage dans l'infrastructure de fiabilité autour de lui : gestion du contexte, permissions, évaluation continue des sorties, et supervision humaine. Ce constat s'inscrit dans un contexte plus large d'incertitude, même chez les laboratoires de pointe, sur la manière dont leurs propres modèles évoluent réellement. La reconnaissance par Anthropic d'une "capability overhead" imprévisible chez Claude Fable illustre cette difficulté à garder le contrôle sur des systèmes de plus en plus complexes. D'où l'émergence d'une deuxième tendance identifiée lors du salon, celle du "loop engineering" comme nouvelle couche de contrôle, les boucles d'exécution des agents devenant elles-mêmes un objet d'ingénierie à part entière, au même titre que le modèle ou le harnais qui l'entoure.

💬 AutoGPT quasiment aux abonnés absents cette année, ça dit tout. Trois ans après le délire sur les agents totalement autonomes, l'industrie a compris que ça ne tient pas à grande échelle, et que le vrai boulot c'est le harnais autour : contexte, permissions, évaluation continue. L'AI engineering est en train de passer de la promesse de robots qui bossent tout seuls à la construction de plomberie fiable, et c'est bien plus solide que ça en a l'air.

OutilsOutil
1 source
[VIDÉO]Claude AI : les fonctionnalités que 99 % des débutants ignorent
656Le Big Data 

[VIDÉO]Claude AI : les fonctionnalités que 99 % des débutants ignorent

Une nouvelle vidéo publiée sur LEBIGDATA.FR détaille les fonctionnalités de Claude AI que la plupart des débutants n'exploitent jamais. Le constat de départ est simple: la grande majorité des utilisateurs se limite à Claude Chat, l'interface conversationnelle classique accessible sur navigateur, mobile et ordinateur, sans savoir qu'elle ne représente qu'une fraction de ce que propose réellement l'assistant d'Anthropic. La vidéo recense six fonctionnalités au total, dont cinq restent largement méconnues du grand public. Parmi elles figurent des outils permettant d'agir directement sur les fichiers et le système de l'utilisateur, une fonction pour déléguer des tâches à distance depuis un smartphone, ainsi qu'un module dédié à la création d'applications complètes sans nécessiter de compétences en développement. Deux modules complémentaires viennent enfin étendre ces capacités pour automatiser des tâches répétitives. Cette méconnaissance a un coût concret pour les utilisateurs professionnels et occasionnels de Claude: se cantonner au simple chat revient à se priver d'un gain de productivité potentiellement important, notamment pour les tâches d'automatisation ou de développement rapide d'applications. Savoir qu'un outil no-code de création d'applications existe au sein de Claude, par exemple, peut éviter de passer par des solutions tierces payantes ou de faire appel à un développeur pour des besoins simples. De la même façon, la possibilité de déléguer des tâches depuis un téléphone change la manière dont l'IA peut s'intégrer dans un usage nomade, en dehors du poste de travail habituel. Ce type de contenu pédagogique s'inscrit dans une tendance plus large: à mesure que les assistants IA comme Claude, ChatGPT ou Gemini multiplient les fonctionnalités avancées (agents, exécution de code, intégrations tierces), l'écart se creuse entre utilisateurs avertis et grand public, qui reste souvent bloqué sur l'usage conversationnel de base. Anthropic, comme ses concurrents, mise sur ces couches supplémentaires pour justifier des offres payantes et fidéliser une base d'utilisateurs professionnels, ce qui rend ce genre de tutoriel utile pour combler l'écart de connaissance entre les capacités réelles de l'outil et son usage effectif.

OutilsTuto
1 source
Le fil autonome des agents pour VideoAgent : analyse d'intention, planification par graphe et routage d'outils pour le montage vidéo
657MarkTechPost 

Le fil autonome des agents pour VideoAgent : analyse d'intention, planification par graphe et routage d'outils pour le montage vidéo

Voici un article de type MarkTechPost décrivant un tutoriel de construction d'un système multi-agents pour l'édition vidéo automatisée. Je le résume selon vos consignes. Un tutoriel technique publié récemment détaille la reconstruction complète d'un système multi-agents inspiré de VideoAgent, conçu pour comprendre, indexer, éditer et remonter des vidéos à partir d'instructions en langage naturel. L'architecture repose sur plusieurs modules assemblés en pipeline: un parseur d'intentions qui interprète les requêtes de l'utilisateur, une bibliothèque d'agents spécialisés, un routeur d'outils, un planificateur sous forme de graphe d'exécution, et un optimiseur dit "à gradient textuel" capable de détecter et réparer automatiquement les dépendances manquantes dans ce graphe. Ces composants pilotent des outils concrets de traitement vidéo: FFmpeg pour le montage, la transcription par Whisper, la détection de scènes, l'échantillonnage d'images clés, le sous-titrage automatique, l'indexation cross-modale, la recherche par similarité, le découpage de séquences et le montage synchronisé sur le rythme musical. Le système peut fonctionner sans clé API grâce à une couche d'abstraction (classe LLM) compatible avec plusieurs fournisseurs, dont OpenAI, DeepSeek, Anthropic et Google Gemini, avec des modèles par défaut comme gpt-4o-mini ou claude-3-5-sonnet-latest. La configuration prévoit notamment quatre "prises" maximum par tâche (maxshots) et quatre cycles d'optimisation (optrounds), avec quatre scénarios de démonstration: réponse à des questions sur une vidéo, génération de résumé, production d'un aperçu façon reportage d'actualité et montage synchronisé. L'intérêt de cette démarche dépasse le simple exercice pédagogique: elle offre aux développeurs et chercheurs un modèle reproductible pour construire des agents IA capables de raisonner sur du contenu vidéo de bout en bout, sans dépendre d'un service cloud propriétaire unique. Pour les créateurs de contenu, les rédactions ou les équipes marketing, ce type de système pourrait automatiser des tâches aujourd'hui chronophages comme le dérushage, la génération de résumés vidéo ou le montage calé sur la musique, réduisant le temps de production tout en conservant un contrôle par instructions textuelles simples. Ce projet s'inscrit dans une tendance plus large de l'IA appliquée à la vidéo, où les architectures multi-agents et les graphes de planification remplacent progressivement les pipelines rigides à étape unique. La capacité à réparer automatiquement un graphe d'exécution incomplet, via l'optimisation par gradient textuel, illustre une recherche active sur la robustesse des systèmes agentiques face à des instructions ambiguës. Combiné à des briques désormais matures comme Whisper pour la transcription ou les modèles d'embeddings pour la recherche cross-modale, ce type d'architecture ouvre la voie à des outils d'édition vidéo pilotés entièrement par le langage naturel, accessibles à des équipes ne disposant pas de compétences en montage traditionnel.

OutilsTuto
1 source
Google Photos lance Video Remix, l’IA qui remixe vos vidéos en quelques clics
658Le Big Data 

Google Photos lance Video Remix, l’IA qui remixe vos vidéos en quelques clics

Google a annoncé le 8 juillet 2026 le lancement de Video Remix (aussi appelé Remix Video) dans Google Photos, un nouvel outil d'édition vidéo propulsé par son modèle Gemini Omni. La fonctionnalité apparaît dans l'onglet Créer de l'application, aux côtés des collages et des vidéos générées à partir de photos. Le principe est simple : l'utilisateur sélectionne un clip de dix secondes maximum, choisit un modèle dans une bibliothèque de styles prédéfinis, et Gemini Omni produit automatiquement une nouvelle version transformée, sans passer par un logiciel de montage comme Premiere Pro. L'IA peut ajuster l'éclairage d'une scène trop sombre, ajouter une lumière matinale plus flatteuse, ou remplacer entièrement l'arrière-plan, Google citant l'exemple d'une personne repositionnée dans une serre. Les options artistiques permettent aussi de transformer une vidéo en aquarelle animée, en peinture à l'huile ou en carnet de croquis. Le traitement peut prendre de quelques secondes à quelques minutes selon la complexité de la demande. L'outil est réservé aux abonnés éligibles de Google AI Plus, Pro et Ultra, et le déploiement démarre dans une quinzaine de pays, dont les États-Unis, l'Inde, le Japon, la Corée du Sud, le Brésil, le Mexique, l'Argentine, l'Égypte, l'Indonésie, le Pakistan, les Philippines, le Bangladesh, la Colombie et la Turquie. La France n'en fait pas partie et aucune date locale n'a été communiquée. Cette annonce marque une nouvelle étape dans l'automatisation du montage vidéo grand public, un domaine jusqu'ici dominé par des logiciels professionnels exigeant des compétences techniques. En rendant accessible en quelques clics des effets qui demandaient auparavant du temps et de l'expertise, Google abaisse la barrière d'entrée pour produire du contenu visuellement soigné, ce qui pourrait peser sur l'usage d'outils comme Premiere Pro pour les tâches simples. Pour les utilisateurs de Google Photos, cela transforme une application de stockage et de tri de souvenirs en véritable studio de création. L'exclusion de la France du lancement initial illustre aussi les arbitrages réglementaires ou logistiques que Google opère marché par marché, un frein régulier constaté sur ses déploiements d'IA en Europe. Video Remix s'inscrit dans la stratégie plus large de Google autour de Gemini Omni, présenté après les modèles Nano Banana et Veo 3.1, censé mieux gérer des sources hétérogènes et comprendre des principes physiques comme la gravité ou l'énergie cinétique. Les contenus générés sont marqués par SynthID, l'outil maison de traçabilité des créations IA, un signal de la volonté de Google d'anticiper les critiques sur la désinformation visuelle. Cette fonction prolonge une série d'ajouts IA à Google Photos, après la retouche d'image automatisée et l'amélioration de la recherche intelligente, confirmant que l'application devient un laboratoire d'expérimentation pour les capacités génératives de Google appliquées à l'usage personnel.

UELa France est exclue du lancement initial de Video Remix, sans date de disponibilite communiquee, illustrant les retards recurrents des deploiements IA de Google en Europe.

Google AI Studio ajoute l'import depuis GitHub pour créer une application déployable
659MarkTechPost 

Google AI Studio ajoute l'import depuis GitHub pour créer une application déployable

Google AI Studio propose désormais une fonction "Import from GitHub" dans son mode Build, qui convertit automatiquement un dépôt de code en un format compatible avec son environnement d'exécution. L'annonce a été faite le 8 juillet 2026 par le compte officiel de Google AI Studio ainsi que par Logan Kilpatrick, qui dirige le produit. Selon lui, l'outil récupère un dépôt GitHub existant, le transforme "automagiquement" pour qu'il fonctionne dans l'environnement AI Studio, puis permet à l'utilisateur de continuer à l'améliorer directement dans l'interface, avant de le déployer. Le mode Build d'AI Studio est la surface de "vibe coding" de Google: l'utilisateur décrit une application dans un prompt, Gemini génère une application complète avec aperçu en direct, puis l'utilisateur affine le résultat par chat ou par annotations directes sur l'interface. Cette nouvelle fonctionnalité ajoute donc un point de départ alternatif au prompt vide: au lieu de partir de zéro, on peut pointer Build vers un dépôt GitHub existant, qui devient la base du projet. Cette évolution change concrètement la façon dont les développeurs peuvent réutiliser du code existant plutôt que de repartir d'une simple description textuelle. Elle facilite trois usages typiques: relancer un projet de hackathon resté à l'abandon pendant plusieurs mois en important son dépôt puis en demandant à Build d'ajouter de nouvelles fonctionnalités avant un déploiement sur Cloud Run; intégrer rapidement un nouveau collaborateur en import ant un dépôt public partagé pour générer une interface de démonstration et lui transmettre un lien d'aperçu fonctionnel; ou encore transformer un simple script de prototype utilisant l'API Gemini en une véritable application dotée d'une interface, via le mode annotation. Un point technique documenté par Google mérite l'attention des développeurs: pour les applications qui appellent l'API Gemini, AI Studio configure la clé GEMINIAPIKEY comme un secret côté serveur, jamais incluse dans le code exécuté côté client. Les dépôts qui appellent actuellement l'API Gemini directement depuis le navigateur devront donc être adaptés à ce modèle serveur pour éviter d'exposer leur clé. Google n'a pas publié les détails techniques internes du processus d'import: en pratique, l'outil lit le contenu du dépôt, l'adapte au runtime d'AI Studio, puis l'ouvre dans l'éditeur Build. Cette fonction s'ajoute à deux mécanismes déjà existants entre AI Studio et GitHub: l'export ou "push" vers GitHub, qui crée un dépôt et y commit le code généré par l'application (historiquement à raison d'un dépôt par application), et le téléchargement sous forme de fichier ZIP pour un développement local dans un éditeur comme VS Code ou Cursor. Avec l'import depuis GitHub, Google referme la boucle en permettant aussi le sens inverse, du dépôt vers l'environnement de développement assisté par IA. Cette annonce s'inscrit dans la compétition plus large entre plateformes de "vibe coding" cherchant à réduire la friction entre code existant et génération assistée par IA, un terrain où Google, avec Gemini et AI Studio, cherche à concurrencer des outils comme Replit, Vercel v0 ou Cursor. Les détails précis du fonctionnement interne de cette fonctionnalité restent encore à préciser par Google dans les prochaines semaines.

OutilsOutil
1 source
Google AI Studio ajoute « Import from GitHub » au mode Build, pour transformer un dépôt existant en application modifiable et déployable
660MarkTechPost 

Google AI Studio ajoute « Import from GitHub » au mode Build, pour transformer un dépôt existant en application modifiable et déployable

Google déploie une nouvelle fonctionnalité baptisée « Import from GitHub » au sein du mode Build de Google AI Studio, son outil de développement d'applications par intelligence artificielle. L'annonce a été faite le 8 juillet 2026 simultanément par le compte officiel de Google AI Studio et par Logan Kilpatrick, qui dirige le produit. Concrètement, l'outil permet de pointer vers un dépôt GitHub existant et de le transformer automatiquement en un format compatible avec le runtime d'AI Studio. Une fois importé, le code devient éditable directement dans l'interface, via le chat ou le mode annotation, puis peut être déployé en un clic. Le mode Build fonctionne jusqu'ici sur un principe de « vibe coding » : l'utilisateur décrit une application dans un prompt, et Gemini génère une application complète avec un aperçu en direct. Cette nouveauté ajoute un second point d'entrée : au lieu de partir d'une page blanche, on peut désormais partir d'un projet déjà écrit et hébergé sur GitHub. Google n'a pas détaillé publiquement le fonctionnement interne de l'import, mais le principe reste simple : lire le dépôt, l'adapter aux contraintes du runtime, puis l'ouvrir dans l'environnement Build pour permettre de continuer à l'améliorer. Cette fonctionnalité change concrètement la façon dont les développeurs peuvent réutiliser du code existant plutôt que de repartir de zéro. Elle vise notamment trois usages précis : relancer un projet de hackathon abandonné depuis des mois en lui ajoutant rapidement de nouvelles fonctionnalités comme une page de réglages avant de le déployer sur Cloud Run, permettre à un collègue de récupérer un dépôt public partagé pour en générer une interface de démonstration et obtenir un lien de prévisualisation en direct, ou encore transformer un simple script de prototype utilisant l'API Gemini en une véritable application dotée d'une interface via le mode annotation. Un point technique mérite d'être souligné pour les développeurs qui migrent du code appelant l'API Gemini : AI Studio configure automatiquement la clé GEMINIAPIKEY comme un secret côté serveur, jamais exposée dans le code client. Cela signifie que les dépôts appelant l'API directement depuis le navigateur devront être adaptés pour passer par un point d'accès serveur, une pratique déjà recommandée pour des raisons de sécurité. Cette annonce s'inscrit dans la compétition croissante entre les plateformes de développement assisté par IA, où Google, avec AI Studio, cherche à réduire la friction entre l'écriture de code traditionnelle et la génération automatisée. L'outil complète d'autres flux déjà proposés par la plateforme, comme l'export d'une application générée vers un nouveau dépôt GitHub ou le téléchargement du code sous forme de fichier ZIP pour un développement local dans des environnements comme VS Code ou Cursor. Avec cette fonctionnalité d'import, Google referme la boucle en permettant désormais une circulation dans les deux sens entre GitHub et AI Studio. Les détails techniques exacts de la conversion restent encore peu documentés, l'entreprise ayant présenté l'outil comme fraîchement déployé et amené à évoluer.

OutilsOutil
1 source
ChatGPT peut désormais écouter et parler en même temps, rendant les conversations avec l'IA plus naturelles
661The Decoder 

ChatGPT peut désormais écouter et parler en même temps, rendant les conversations avec l'IA plus naturelles

Voici le texte traduit et résumé : ChatGPT peut désormais écouter et parler en même temps grâce à GPT-Live, une nouvelle architecture full-duplex développée par OpenAI. Concrètement, l'assistant vocal n'a plus besoin d'attendre la fin de la phrase de l'utilisateur pour commencer à répondre, ce qui rend les échanges beaucoup plus fluides. Pour les questions complexes, le système bascule discrètement en arrière-plan vers GPT-5.5, un modèle plus puissant, avant de restituer la réponse à l'oral. GPT-Live-1, la version complète, est déjà disponible pour les abonnés payants de ChatGPT, tandis qu'une version allégée, GPT-Live-1-mini, équipe les comptes gratuits. L'accès via l'API doit suivre dans les prochaines semaines. Cette avancée technique change concrètement la nature des interactions vocales avec l'IA. Jusqu'ici, les assistants conversationnels fonctionnaient sur un mode séquentiel rigide : l'utilisateur parle, puis attend, puis l'IA répond. Avec le full-duplex, les interruptions, hésitations et reformulations en cours de phrase deviennent possibles, comme dans une vraie conversation humaine. Pour les usages professionnels comme l'assistance client ou la dictée assistée, cela réduit la friction et améliore l'expérience perçue, un facteur clé alors que les entreprises cherchent à déployer des agents vocaux plus naturels. Cette évolution s'inscrit dans la course entre grands acteurs de l'IA générative pour rendre les interfaces vocales indiscernables d'une conversation humaine, un terrain où Google et son assistant Gemini, ainsi que d'autres concurrents, investissent également massivement. Le choix d'OpenAI de combiner un modèle léger pour la fluidité conversationnelle et un modèle lourd, GPT-5.5, pour la profondeur de raisonnement illustre une stratégie d'architecture hybride qui pourrait s'imposer comme standard. Reste à voir comment cette technologie se comportera à grande échelle une fois ouverte aux développeurs via l'API, et si la latence promise tiendra ses promesses en conditions réelles d'usage.

Le Slackbot de Slack peut désormais récupérer vos données CRM, générer des graphiques et envoyer des DocuSign, le tout depuis un message
662VentureBeat AI 

Le Slackbot de Slack peut désormais récupérer vos données CRM, générer des graphiques et envoyer des DocuSign, le tout depuis un message

Cinq ans après le rachat de Slack par Salesforce pour 27,7 milliards de dollars, les deux plateformes commencent enfin à fonctionner comme un système unique. Slack a lancé mardi une intégration reliant Slackbot, l'agent IA personnel présent dans chaque espace de travail, à l'ensemble de la plateforme Salesforce : données CRM, analyses Tableau, profils clients Data 360 et une constellation croissante d'applications tierces, le tout accessible via une simple invite conversationnelle. Cette expansion s'appuie sur des serveurs dédiés au protocole MCP (Model Context Protocol), développés par Salesforce pour connecter Slackbot à son infrastructure Headless 360. Concrètement, un commercial peut désormais demander à Slackbot l'historique des transactions d'un client, obtenir une visualisation Tableau en direct des tendances de pipeline, mettre à jour un enregistrement CRM et déclencher une signature DocuSign, sans jamais changer d'onglet ni se connecter à une autre application. Selon Slack, l'équipe informatique interne de Salesforce utilise déjà cette architecture pour faire économiser à ses plus de 1 500 ingénieurs des milliers d'heures de développement sur mesure chaque année. Ce lancement intervient dans un contexte de pression concurrentielle croissante. Microsoft Teams revendique plus de 320 millions d'utilisateurs actifs mensuels et intègre Copilot dans toute la suite Office, tandis que Google renforce la présence de Gemini dans Workspace. Plus préoccupant encore pour Salesforce, le média The Information a rapporté il y a quelques jours que certaines petites entreprises utilisent Claude d'Anthropic pour remplacer entièrement leur CRM Salesforce : une société de gestion immobilière basée à Atlanta, forte d'environ 55 employés, aurait ainsi économisé près de 100 000 dollars par an en construisant son propre système avec Claude Code et Replit. C'est dans ce contexte que Ryan Gavin, directeur marketing de Slack, a accordé un entretien à VentureBeat pour défendre l'idée d'une "IA multijoueur", estimant que les 25 années de données clients accumulées par Salesforce constituent un atout qu'aucune alternative bricolée à la va-vite ne peut reproduire. Pour Gavin, la plupart des assistants IA actuels, ChatGPT, Claude, Copilot, fonctionnent en mode solo : un utilisateur interroge un modèle, obtient une réponse et agit seul, l'information restant invisible pour ses collègues. Il redoute que chaque application d'entreprise ne génère ses propres agents isolés, aggravant le problème de fragmentation des outils plutôt que de le résoudre. La réponse de Slack consiste à faire de Slackbot une couche d'orchestration centrale. Puisque tout se déroule dans des canaux partagés, chaque action entreprise par un agent, comme récupérer un profil client, signaler un risque commercial ou mettre à jour un ticket Jira, reste visible par toute l'équipe, qui peut alors rediriger, enrichir ou corriger le travail de l'agent en temps réel. Sur le plan technique, cette intégration repose sur le Model Context Protocol, un standard ouvert initialement développé par Anthropic pour permettre aux modèles d'IA de découvrir et d'invoquer des outils externes. Adopté rapidement par l'écosystème de l'IA, MCP équipait déjà début 2026 des outils comme Claude Code, illustrant la manière dont ce standard devient une infrastructure de référence pour connecter agents conversationnels et systèmes d'entreprise, un enjeu qui dépasse largement le seul duo Slack-Salesforce.

💬 C'est le vrai test : Slack veut prouver que 25 ans de données CRM valent plus qu'un agent bricolé maison, et l'histoire de la boîte immobilière qui a viré Salesforce pour du Claude Code fait à 100 000 dollars par an montre que le pari n'est pas gagné d'avance. Sur le papier, l'orchestration visible en canal partagé règle le vrai problème (les agents isolés qui bossent chacun dans leur coin), mais ça reste un pari défensif de Salesforce plus qu'une révolution d'usage. Le signal le plus intéressant, en fait, c'est que MCP s'impose comme la prise standard entre IA et logiciels d'entreprise, bien au-delà du duo Slack-Salesforce.

OutilsOutil
1 source
Lilian Weng résume 35 articles sur l'ingénierie des harnais pour l'auto-amélioration récursive
663Latent Space 

Lilian Weng résume 35 articles sur l'ingénierie des harnais pour l'auto-amélioration récursive

Chercheuse chez Thinky (dont elle est cofondatrice), Lilian Weng a publié le 6 juillet 2026 une synthèse de 35 articles de recherche consacrés au "harness engineering", ces couches d'orchestration qui encadrent le fonctionnement des agents d'intelligence artificielle. Son texte relie cette discipline à l'auto-amélioration récursive des systèmes d'IA, en affirmant que même lorsque les progrès réalisés au niveau du harnais finissent par être absorbés dans le modèle central, le besoin de spécifier des objectifs et du contexte ne disparaît pas. Elle y passe en revue les principales tendances de conception éprouvées, en citant notamment l'article ACE et le concept plus récent de Meta-Harnesses. Le même jour, Meta Superintelligence Labs a dévoilé Muse Image et présenté en avant-première Muse Video, deux modèles de génération d'image et de vidéo présentés par Alexandr Wang et Tim Brooks comme les meilleurs de leur catégorie, mais sans publication scientifique ni détail technique associé. Cette convergence autour de l'ingénierie des harnais illustre un basculement plus large dans la conception des agents d'IA: plutôt que de chercher l'auto-amélioration directe des poids d'un modèle, les laboratoires misent sur l'optimisation de l'environnement logiciel qui entoure ce modèle. Ce choix a des conséquences concrètes pour les développeurs et les entreprises qui déploient des agents en production, car il déplace une partie de la valeur ajoutée vers l'orchestration plutôt que vers le modèle brut. Anthropic illustre cette tendance avec l'extension de Claude Cowork au mobile et au web, positionnant Claude comme un coéquipier de tâches en arrière-plan plutôt qu'une simple interface de chat, tandis que l'accès à Claude Fable 5 a été prolongé jusqu'au 12 juillet sur les offres payantes, une annonce qui a suscité des critiques sur le calendrier des quotas hebdomadaires. Ce virage s'inscrit dans une compétition plus vaste sur l'infrastructure agentique. Google a enrichi son Gemini API Managed Agents avec l'exécution en arrière-plan, des serveurs MCP distants, des appels de fonctions personnalisés et le renouvellement automatique des identifiants. LangChain a lancé un cours sur les Deep Agents et un projet de harnais open source, tandis que Weaviate a rendu son serveur MCP disponible en version générale avec un contrôle d'écriture activable en temps réel. Du côté des outils grand public, Codex Mobile sur iOS a ajouté la gestion de tâches et la comparaison de branches, et Hermes Agent a intégré la gestion de secrets avec 1Password. Ces annonces, recensées par la newsletter AI News de Latent Space après avoir passé en revue douze subreddits et 544 comptes Twitter, dessinent un secteur où la maîtrise du harnais devient un enjeu stratégique aussi important que celui du modèle lui-même.

💬 Le vrai signal, il est là : le modèle n'est plus le seul truc qui compte, c'est tout ce qu'on construit autour. Quand Google, Anthropic et LangChain sortent des briques d'orchestration le même mois que Weng publie sa synthèse, c'est pas un hasard, c'est que la valeur se déplace vers le harnais. Pour Le Fil IA je le dis clairement : la prochaine bataille compétitive en IA ne se jouera pas sur les poids du modèle, mais sur qui sait le mieux l'encadrer et le déployer.

RecherchePaper
1 source
Google crée la polémique avec une publicité IA mettant en scène l’Histoire américaine
664Le Big Data 

Google crée la polémique avec une publicité IA mettant en scène l’Histoire américaine

Google a diffusé une publicité destinée à promouvoir Google Workspace et Gemini, imaginant à quoi aurait ressemblé la rédaction de la Déclaration d'indépendance américaine de 1776 si les pères fondateurs avaient disposé de l'intelligence artificielle. Dans cette vidéo intitulée « Un travail de groupe, mais en 1776 », Benjamin Franklin envoie un message à Thomas Jefferson pour connaître l'avancement du document. Jefferson photographie son brouillon, que Gemini retranscrit automatiquement dans Google Docs, avant que Franklin et John Adams n'y apportent des suggestions de modification. L'outil d'IA organise également une réunion, prend des notes pendant un appel Google Meet et coordonne la collaboration entre les rédacteurs. La publicité inclut aussi une séquence humoristique où l'outil de génération d'images Nano Banana crée un sceau des États-Unis en remplaçant l'aigle par une dinde, référence à l'anecdote selon laquelle Benjamin Franklin aurait préféré cet animal comme symbole national. Mais c'est une autre scène qui a suscité la controverse : juste avant la signature du document, les pères fondateurs demandent à Gemini s'il serait pertinent d'accorder au roi George III un droit de modification sur la Déclaration d'indépendance. Cette blague a provoqué un malaise chez de nombreux spectateurs plutôt que l'amusement escompté par Google. Le problème dépasse le simple mauvais goût : en associant l'IA à un moment fondateur de l'histoire américaine où la question centrale était précisément l'affranchissement d'une autorité extérieure, la publicité semble minimiser l'enjeu politique et symbolique de cet épisode. Pour une entreprise qui cherche à démontrer l'utilité de ses outils d'IA générative auprès du grand public et des professionnels, ce type de faux pas peut ternir l'image de la marque et alimenter le scepticisme déjà présent autour de l'IA, notamment sur sa capacité à comprendre le contexte et la sensibilité de certains sujets. Cela illustre aussi les risques que prennent les grandes entreprises technologiques lorsqu'elles tentent d'ancrer leurs produits dans des récits culturels ou historiques forts, sans toujours mesurer l'accueil que cela recevra. Cette controverse s'inscrit dans un contexte plus large où les géants de la tech multiplient les campagnes publicitaires pour vulgariser l'IA générative auprès du plus grand nombre, avec un succès inégal. Angus Johnston, professeur d'histoire à l'université CUNY, a résumé sur Bluesky les critiques adressées à Google : même présentée comme une plaisanterie, la publicité ne parvenait pas à démontrer que l'IA constitue un outil réellement utile pour l'organisation politique, l'écriture ou la collaboration humaine, ce qui était pourtant son objectif premier. Cet épisode rappelle les précédentes polémiques rencontrées par d'autres publicités liées à l'IA, où l'humour ou la mise en scène ont parfois été perçus comme déplacés par le public. Reste à savoir si Google retirera ou modifiera cette campagne, et comment l'entreprise ajustera sa communication future pour éviter de nouveaux faux pas sur des sujets sensibles.

SociétéActu
1 source
Synthetic Sciences lance OpenScience, un atelier IA open source et agnostique pour la recherche en machine learning, biologie, physique et chimie
665MarkTechPost 

Synthetic Sciences lance OpenScience, un atelier IA open source et agnostique pour la recherche en machine learning, biologie, physique et chimie

Synthetic Sciences a dévoilé OpenScience, un espace de travail IA open source destiné à la recherche scientifique, disponible sous licence Apache 2.0 et déployable sur sa propre infrastructure. L'équipe présente ce projet comme une alternative ouverte à Claude Science, l'outil lancé par Anthropic fin juin 2026, tout en précisant qu'il s'agit d'un projet indépendant, non affilié à l'entreprise. OpenScience s'installe via npm avec la commande openscience, ou directement en une étape avec npx synsci, sans nécessiter de compte pour démarrer. L'outil est agnostique vis-à-vis des modèles : il fonctionne avec Claude, GPT, Gemini, GLM, Kimi, DeepSeek ou des modèles open-weight affinés localement, chacun utilisable via ses propres clés API et interchangeable à chaque requête depuis un sélecteur intégré à l'interface. Il embarque plus de 250 compétences modifiables couvrant l'entraînement de modèles (DeepSpeed, PEFT, TRL), l'évaluation, la chimie computationnelle ou la biologie moléculaire et clinique, ainsi qu'un accès direct à une trentaine de bases de données scientifiques comme UniProt, PDB, ChEMBL, arXiv, OpenAlex ou Semantic Scholar, exploitées comme outils par l'agent. L'enjeu affiché par Synthetic Sciences est de ne pas laisser les outils d'IA scientifique dépendre d'un seul fournisseur. En gardant le flux de travail ouvert, les modèles interchangeables et les données locales, OpenScience s'adresse aux laboratoires, équipes de recherche et développeurs qui veulent garder le contrôle sur leurs clés, leurs coûts et leurs résultats plutôt que de dépendre d'une plateforme propriétaire. Concrètement, l'outil automatise l'ensemble du cycle de recherche : lecture de la littérature scientifique, formulation d'hypothèses, écriture et exécution de code, conduite d'expériences, analyse des résultats et rédaction, le tout dans une seule session continue affichée dans le navigateur. Cette approche pourrait accélérer des tâches habituellement fragmentées entre plusieurs outils, tout en évitant le verrouillage propriétaire qui inquiète une partie de la communauté scientifique et technique face à la montée des assistants IA spécialisés. Le lancement s'inscrit directement dans le sillage de Claude Science, présenté par Anthropic fin juin 2026 comme un outil de recherche assistée par IA. OpenScience reprend une architecture similaire, avec un serveur local hébergeant l'interface, le moteur d'agents et la couche d'outils, mais mise sur l'ouverture totale du code et l'absence de dépendance à un fournisseur unique. Le projet propose également une option payante facultative baptisée Atlas, qui donne accès à un ensemble de modèles de pointe sélectionnés, facturés depuis un portefeuille prépayé, ainsi qu'à un graphe de recherche persistant et à du calcul cloud, mais cette couche reste entièrement optionnelle. L'extensibilité est un axe central du projet, avec la prise en charge de serveurs MCP, de l'intégration LSP, de plugins et d'agents personnalisés, complétée par un kit de développement TypeScript, ce qui laisse présager une intégration croissante de ce type d'outils dans les workflows de recherche scientifique au cours des prochains mois.

💬 Enfin quelqu'un qui répond à Claude Science par du code plutôt que par un communiqué. Sur le papier, 250 compétences et un agnosticisme total sur les modèles, ça a de la gueule, mais le vrai test c'est si un labo arrive à le faire tourner sans un ingénieur dédié à plein temps derrière. Selon Le Fil IA, l'open source devient la vraie réponse concurrentielle aux outils propriétaires d'Anthropic et OpenAI, pas les discours sur l'éthique.

OutilsOutil
1 source
Extraction PDF vers JSON structuré : guide des modèles open source en 2026
666MarkTechPost 

Extraction PDF vers JSON structuré : guide des modèles open source en 2026

Les modèles ouverts pour transformer les PDF en JSON structuré se multiplient en ce début d'année, avec deux familles d'outils distinctes. Datalab, l'équipe derrière Marker et Surya, a lancé lift, un modèle de vision de 9 milliards de paramètres construit sur Qwen 3.5, capable de remplir un schéma JSON fourni par l'utilisateur grâce à un décodage contraint qui garantit une sortie valide. Sur un benchmark maison de 225 documents, lift atteint 90,2% de précision par champ avec une latence médiane de 9,5 secondes, devançant NuExtract3 (81,5%) et Qwen3.5-9B (76,3%), mais restant derrière Gemini Flash 3.5 (91,3%) et l'API hébergée de Datalab (95,9%). La précision sur un document entier reste toutefois faible, à 20,9% pour lift. De son côté, NuMind propose NuExtract 3, un modèle vision-langage de 4 milliards de paramètres qui combine extraction structurée et extraction de contenu (OCR vers Markdown) au sein d'un même outil, entraîné par renforcement pour ajouter un raisonnement spécifique à l'extraction, activable à la demande. Enfin, Docling, projet né chez IBM Research et désormais hébergé par la LF AI & Data Foundation, s'attaque à un autre problème : reconstruire la mise en page complète d'un document (PDF, DOCX, PPTX, XLSX, HTML, images) en JSON, Markdown, HTML ou DocTags, via sa représentation interne DoclingDocument. Cette distinction entre extraction guidée par schéma et analyse complète de document compte parce que la plupart des données d'entreprise restent aujourd'hui prisonnières de PDF, de scans et de présentations, inutilisables telles quelles par les modèles de langage et les agents. Choisir la mauvaise catégorie d'outil fait perdre un temps considérable : l'extraction par schéma convient aux factures, formulaires et contrats où les champs sont connus à l'avance, tandis que l'analyse de document sert à préparer des corpus propres pour la génération augmentée par récupération (RAG) et les agents. L'argument économique est tout aussi concret : les API propriétaires peuvent coûter plusieurs milliers de dollars par million de pages traitées et imposent d'envoyer les documents hors des infrastructures internes, alors que les modèles locaux suppriment ces deux contraintes de coût et de confidentialité. Cette vague d'outils s'inscrit dans une tendance plus large de rapprochement entre les performances des modèles ouverts et celles des API commerciales fermées, en particulier chez les acteurs spécialisés dans l'extraction de documents comme Datalab et NuMind. Les licences restent toutefois un point de vigilance : le code de lift est publié sous Apache-2.0, mais ses poids utilisent une licence OpenRAIL-M modifiée, gratuite pour la recherche, l'usage personnel et les startups générant moins de 5 millions de dollars de financement ou de revenus, mais soumise à licence payante pour un déploiement commercial en interne, sans possibilité de concurrencer l'API de Datalab elle-même. Pour les équipes techniques qui bâtissent des pipelines documentaires, la question n'est donc plus seulement technique mais aussi contractuelle, à mesure que ces modèles ouverts gagnent en maturité.

💬 Le chiffre qui compte, c'est le 20,9% de précision sur document entier pour lift, pas le 90% par champ qu'on met en avant partout. Ça veut dire qu'aucun de ces modèles n'est encore fiable sans un humain qui relit derrière, malgré des scores qui donnent l'impression que le problème est réglé. Et la licence de lift, gratuite en dessous de 5 millions de revenus mais payante au-delà, rappelle que l'open source des modèles de doc reste open source jusqu'à ce que ça marche vraiment.

OutilsOutil
1 source
L'ancien responsable de Qwen explique les erreurs du hybrid thinking et pourquoi il mise desormais sur les agents
667MarkTechPost 

L'ancien responsable de Qwen explique les erreurs du hybrid thinking et pourquoi il mise desormais sur les agents

Junyang Lin, qui dirigeait le projet Qwen chez Alibaba, a annoncé son départ le 3 mars 2026 et se présente désormais comme chercheur indépendant. Dans une conférence intitulée "Qwen : vers un modèle ou agent généraliste", il retrace toute la famille Qwen, de QwQ-32B à Qwen2.5-Max, en passant par Qwen3, Qwen2.5-VL et Qwen2.5-Omni, en comparant leurs performances à celles de DeepSeek-R1, Grok 3 Beta, Gemini 2.5 Pro et la série o d'OpenAI. Qwen3 occupe la place centrale de l'exposé : Lin y détaille les modes de raisonnement hybrides, avec un mode "réflexion" pour le raisonnement pas à pas et un mode "instruction" pour des réponses quasi instantanées, ainsi que des budgets de réflexion ajustables par l'utilisateur. La famille couvre désormais 119 langues et dialectes contre 29 auparavant, avec des tailles allant de 0,6 à 235 milliards de paramètres, disponibles en versions quantifiées GGUF, GPTQ, AWQ et MLX, toutes sous licence Apache 2.0. Les architectures présentées montrent que les petits modèles denses partagent leurs embeddings d'entrée et de sortie avec un contexte de 32 000 tokens, tandis que les modèles plus grands, denses ou à mélange d'experts, abandonnent ce partage et étendent le contexte à 128 000 tokens. Ce que Lin détaille surtout, c'est la difficulté technique derrière cette fusion des modes de réflexion, un enjeu qui dépasse largement Qwen. Un modèle optimisé pour l'instruction est récompensé pour sa rapidité et sa concision, tandis qu'un modèle de raisonnement est récompensé pour le temps qu'il consacre aux problèmes complexes. Fusionner les deux sans précaution dégrade les deux comportements à la fois. Qwen3 a d'abord tenté cette fusion via un pipeline de post-entraînement en quatre étapes, avant que la lignée 2507, plus tard en 2025, ne revienne à des variantes séparées, une pour l'instruction et une pour le raisonnement. Lin y voit avant tout un problème de données plutôt que d'architecture, et cite en contrepoint la trajectoire d'Anthropic, qui a conservé une approche hybride avec Claude 3.7 Sonnet et son budget de réflexion réglable, puis avec Claude 4 qui entrelace raisonnement et usage d'outils pour le code et les tâches longues. Cette réflexion s'inscrit dans un basculement plus large que Lin situe entre deux époques. La première, portée par o1 et DeepSeek-R1, a établi que l'apprentissage par renforcement exige des récompenses vérifiables, plaçant les mathématiques, le code et la logique au centre des efforts. La seconde, qu'il appelle la pensée agentique, consiste à raisonner pour agir : planifier, décider quand utiliser un outil, lire les retours de l'environnement et ajuster sa trajectoire. Ses pistes pour la suite incluent davantage de pré-entraînement, du renforcement fondé sur des retours d'environnement, des contextes plus longs et davantage de modalités, résumées dans sa formule finale : entraîner des agents plutôt que de simples modèles.

💬 L'aveu est rare : le mec qui a dirigé Qwen pendant deux ans dit texto que fusionner mode rapide et mode raisonnement, ça marche pas encore proprement, et qu'ils sont revenus en arrière avec la lignée 2507. Ce que ça révèle, c'est que le hybrid thinking vendu partout comme la norme (Claude, et bientôt tout le monde) reste un problème de données non résolu, pas une simple question d'architecture qu'on règle avec plus de compute. Et son pivot vers "entraîner des agents plutôt que des modèles" confirme un truc que je sens depuis des mois : la course au meilleur benchmark de raisonnement pur touche à sa fin.

LLMsPaper
1 source
Warp lance les "software factories", nouvelle phase du développement logiciel selon son PDG Zach Lloyd
668Latent Space 

Warp lance les "software factories", nouvelle phase du développement logiciel selon son PDG Zach Lloyd

Voici la traduction/résumé de l'article : Warp, le terminal fondé en 2021 par Zach Lloyd, a considérablement évolué depuis ses débuts : conçu à l'origine comme un terminal en Rust avant l'essor de ChatGPT, l'outil est devenu une interface de commande dotée d'agents de codage intégrés, puis, plus récemment, une plateforme d'orchestration baptisée Oz. Face à une concurrence croissante venue de géants technologiques avec Claude Code, Codex CLI et Gemini CLI, Warp a choisi en avril 2026 d'ouvrir le code source de son CLI historique. Lors de l'AI Engineer World's Fair, Lloyd a présenté en keynote le concept de "software factory" (usine logicielle), qu'il dit avoir commencé à formuler il y a environ six mois, à mesure que l'automatisation du développement logiciel gagnait en maturité. Oz vise à connecter plusieurs modèles et environnements de codage, aussi bien en local que dans des sandboxes cloud isolées, tout en s'intégrant aux outils déjà utilisés par les développeurs. Cette évolution traduit un changement de paradigme que Lloyd juge structurant pour l'industrie : le passage d'un travail interactif entre ingénieurs et agents à des systèmes automatisés capables de trier, spécifier, implémenter, réviser, vérifier et surveiller en continu les évolutions d'un logiciel. Selon lui, la plupart des projets logiciels significatifs devraient adopter une forme d'usine automatisée d'ici un an. L'enjeu pour les entreprises n'est plus seulement de faire coder un agent isolé, mais d'automatiser la boucle complète du cycle de développement, en décidant précisément où et quand l'humain doit intervenir, par exemple pour valider les changements à haut risque. Ce virage stratégique s'inscrit dans une tendance plus large de l'écosystème IA, où le terme "software factory" s'est imposé au point de constituer une thématique à part entière lors de conférences spécialisées, aux côtés d'acteurs comme la startup Factory, arrivée indépendamment à un concept similaire. Warp entend fournir l'ensemble des briques de cette pile technologique : dans la prochaine version d'Oz, les utilisateurs pourront configurer leur propre usine logicielle, choisir leurs dépôts de code, définir les étapes du cycle de vie à automatiser, et piloter ce que Lloyd appelle le "plancher de l'usine". Pour Lloyd, peu importe que le terme "software factory" s'impose durablement dans le vocabulaire du secteur : l'essentiel est la bascule, déjà amorcée, d'un développement interactif vers un développement automatisé de bout en bout.

OutilsOutil
1 source
FactSet s’allie à Google Cloud pour intégrer l’IA à ses services financiers
669Le Big Data 

FactSet s’allie à Google Cloud pour intégrer l’IA à ses services financiers

FactSet, l'éditeur américain de données et d'outils financiers, annonce un partenariat stratégique avec Google Cloud pour intégrer les modèles Gemini à sa plateforme FactSet Workstation. L'accord s'articule autour de trois axes principaux. D'abord, l'intégration de la Gemini Enterprise Agent Platform doit permettre à FactSet de lancer une nouvelle génération d'agents financiers capables d'assister les professionnels dans leurs recherches et leurs analyses, en s'appuyant sur les fonctionnalités de recherche avancée et les capacités multimodales de Google. L'ajout de Google Ground doit également élargir les sources d'information exploitées par les outils d'IA de FactSet. Ensuite, sur le plan technique, FactSet enrichira Gemini Enterprise grâce à sa plateforme MCP et à son système de partage d'agents, dans la continuité d'une précédente collaboration avec Google DeepMind, afin d'assurer une interopérabilité fluide entre FactSet Workstation et les outils Google Cloud. Enfin, les deux entreprises développeront conjointement des agents spécialisés dédiés aux opérations de portefeuille, au conseil en fusions-acquisitions et à la finance d'entreprise. FactSet ajoute par ailleurs Google Cloud à son portefeuille de fournisseurs cloud existants, une décision motivée par le renforcement de la résilience et de l'évolutivité de sa plateforme. Pour les banques, sociétés de gestion d'actifs et équipes de finance d'entreprise, cette alliance vise concrètement à accélérer et fiabiliser des tâches aujourd'hui chronophages, comme la recherche documentaire, l'analyse de portefeuille ou la préparation de dossiers de fusion-acquisition. L'enjeu central pour ces institutions n'est pas seulement la vitesse d'exécution mais la traçabilité des données utilisées: dans un secteur soumis à des exigences réglementaires strictes, une réponse générée par IA doit pouvoir être vérifiée et documentée jusqu'à sa source. En misant sur son expertise historique de fournisseur de données financières combinée à l'infrastructure et aux modèles génératifs de Google, FactSet cherche à se positionner comme un intermédiaire de confiance entre les capacités brutes de l'IA générative et les contraintes de conformité du monde financier. Ce partenariat illustre une tendance plus large dans l'industrie: les grands fournisseurs de données financières, à l'image de Bloomberg ou S&P Global, cherchent tous à intégrer l'IA générative sans sacrifier la fiabilité qui constitue leur valeur ajoutée historique. Google Cloud, de son côté, poursuit son offensive dans la finance après sa collaboration avec Google DeepMind, cherchant à démontrer que ses modèles Gemini peuvent s'insérer dans des environnements professionnels exigeants. Sanoke Viswanathan, PDG de FactSet, a souligné que l'intelligence artificielle transforme en profondeur la manière dont les professionnels de la finance travaillent, laissant entrevoir un déploiement progressif de ces agents spécialisés dans les mois à venir.

BusinessActu
1 source
Robot Park : Apptronik ouvre un immense terrain d’entraînement pour ses robots humanoïdes
670Le Big Data 

Robot Park : Apptronik ouvre un immense terrain d’entraînement pour ses robots humanoïdes

Apptronik a inauguré le 30 juin 2026 son Robot Park à Austin, au Texas, un centre d'entraînement de près de 8 400 mètres carrés conçu pour ses robots humanoïdes Apollo 2. Loin des vidéos promotionnelles où les machines montent des escaliers ou servent un café, ce site reproduit des conditions de travail réelles inspirées de la logistique, de l'industrie et du commerce. Plusieurs flottes d'Apollo 2, disponibles en version bipède ou montée sur roues, y répètent des tâches comme le tri ou la manipulation d'objets, encore et encore, afin d'accumuler des millions de données d'entraînement. Pour Jeff Cardenas, PDG d'Apptronik, l'entreprise ne vend pas seulement des robots mais produit aussi des données, un positionnement qui a déjà convaincu les investisseurs : la société a levé plus de 520 millions de dollars pour financer ce développement. L'enjeu dépasse la simple démonstration technologique. Faire marcher un robot une fois devant une caméra est relativement simple ; le rendre fiable, capable de répéter un geste sans erreur dans un environnement imprévisible, est beaucoup plus difficile et constitue le véritable obstacle à l'adoption en entreprise. En misant sur la collecte massive de données plutôt que sur des démonstrations scénarisées, Apptronik cherche à accélérer l'apprentissage automatique de ses machines et à raccourcir le délai avant un déploiement industriel à grande échelle. Ces données alimentent également Gemini Robotics, développé avec Google DeepMind dans le cadre d'un partenariat de recherche visant à combiner les avancées de l'IA générative avec la robotique physique, c'est-à-dire des modèles capables non seulement de répondre à des questions mais aussi d'agir concrètement dans le monde réel. Cette stratégie s'inscrit dans une course de plus en plus disputée entre fabricants de robots humanoïdes, où la rareté des données issues de situations réelles constitue un goulot d'étranglement majeur pour entraîner des modèles performants. Au-delà du Robot Park, Apptronik déploie déjà des prototypes chez des partenaires industriels comme Mercedes-Benz, ce qui lui permet de varier les contextes d'apprentissage de façon difficilement reproductible en laboratoire. Le passage des essais pilotes à des cadences véritablement industrielles reste cependant un défi technique de taille, et Jeff Cardenas lui-même reconnaît que la prudence s'impose. Reste à voir si ces investissements massifs déboucheront, dans les prochaines années, sur des robots humanoïdes réellement utiles et rentables à grande échelle.

UELe partenariat industriel avec Mercedes-Benz, entreprise allemande, offre un point d'ancrage europeen mais sans impact reglementaire ou economique direct en France.

RobotiqueActu
1 source
Les 6 meilleurs outils sans code pour les ingénieurs et développeurs IA
671MarkTechPost 

Les 6 meilleurs outils sans code pour les ingénieurs et développeurs IA

Une nouvelle génération de plateformes sans code redéfinit le quotidien des ingénieurs et développeurs IA, en supprimant les frictions liées à l'infrastructure pour accélérer le passage de l'idée au produit. Parmi les solutions qui se distinguent en 2025, trois émergent comme des références dans leurs segments respectifs. Atoms est une plateforme conçue spécifiquement pour expédier des produits finis plutôt que des prototypes : elle orchestre une architecture multi-agents spécialisés, chercheur, chef de produit, ingénieur, spécialiste SEO, gestionnaire publicitaire, et s'intègre nativement avec des modèles comme GPT et Gemini sans configuration manuelle de clés API. Sim AI, de son côté, est une plateforme open source dotée d'un canvas visuel par glisser-déposer permettant de connecter modèles IA, bases de données et outils métier : elle propose plus de 80 intégrations natives, le support MCP, des déclencheurs variés (webhooks, Slack, GitHub, schedulers) et deux modes de déploiement, cloud managé ou auto-hébergé via Docker pour les environnements sensibles. RAGFlow, enfin, cible la construction d'assistants IA à base de RAG (retrieval-augmented generation) sur des données propriétaires, avec gestion de bases de connaissances multi-formats (PDF, Word, CSV, images), édition fine des chunks et citations en temps réel pour garantir la traçabilité des réponses. Ces outils répondent à une demande croissante : réduire de plusieurs semaines à quelques heures le temps nécessaire pour déployer une application IA en production. L'enjeu est particulièrement critique pour les équipes réduites ou les startups qui ne peuvent pas se permettre de dédier des ressources à la mise en place d'infrastructures backend. En éliminant la configuration serveur, les pipelines d'embedding manuels et l'orchestration d'agents codée à la main, ces plateformes permettent à des profils non techniques de participer directement au développement de systèmes IA complexes. Pour les ingénieurs, le gain est surtout en vitesse d'expérimentation : valider une hypothèse produit prend des heures, pas des sprints entiers. Ce mouvement s'inscrit dans une tendance de fond qui transforme l'écosystème IA depuis 2023 : la démocratisation des modèles fondamentaux via des API accessibles (OpenAI, Anthropic, Google) a créé un terrain fertile pour des couches d'abstraction de plus haut niveau. Le pattern RAG notamment, qui consiste à ancrer les réponses d'un LLM sur des documents réels plutôt que sur ses poids d'entraînement, est devenu un standard industriel, et des outils comme RAGFlow cherchent à en industrialiser le déploiement. La prochaine bataille se joue sur l'agent autonome multi-étapes : plusieurs plateformes parient que l'avantage concurrentiel ne sera plus dans le modèle lui-même, mais dans la qualité de l'orchestration et la facilité avec laquelle des non-développeurs peuvent configurer des workflows complexes sans écrire une seule ligne de code.

OutilsOutil
1 source
Le directeur du déploiement d'OpenAI : croissance de Codex, baisse des prix de l'IA et retour sur investissement
672The Decoder 

Le directeur du déploiement d'OpenAI : croissance de Codex, baisse des prix de l'IA et retour sur investissement

Arnaud Fournier, directeur du déploiement chez OpenAI, a accordé une interview à The Decoder dans laquelle il détaille la stratégie de l'entreprise pour intégrer l'IA au coeur des grandes organisations. Il y évoque la croissance explosive de Codex, l'outil de programmation assistée par IA d'OpenAI, et explique qu'OpenAI entend envoyer ses propres ingénieurs directement dans les entreprises clientes pour accélérer et approfondir cette intégration. Fournier souligne également que le prix de l'intelligence artificielle a chuté de façon marquée ces derniers mois. Cette baisse des coûts change la donne pour les directions d'entreprise qui hésitaient à franchir le pas : l'IA générative devient économiquement viable pour un spectre beaucoup plus large d'acteurs. Fournier insiste aussi sur la boucle de rétroaction entre les clients et les équipes de développement d'OpenAI, les retours du terrain alimentant directement l'amélioration des modèles. La question du retour sur investissement, longtemps centrale dans les freins à l'adoption, est précisément ce que cette approche d'accompagnement terrain vise à lever. OpenAI intensifie ainsi sa présence dans le segment entreprise alors que la concurrence s'y densifie, avec Anthropic et ses offres Claude for Work, Google avec Gemini for Business, et Microsoft qui intègre l'IA dans toute sa suite 365. Codex s'impose comme l'un des chevaux de bataille d'OpenAI auprès des équipes techniques, et le modèle de déploiement "ingénieurs embarqués" rappelle les stratégies de grands cabinets de conseil, signalant qu'OpenAI ne veut plus seulement vendre des API mais devenir un partenaire d'intégration à long terme.

💬 Envoyer ses propres ingénieurs chez les clients, c'est le signe qu'OpenAI a compris que vendre une API ne suffit plus. La vraie bataille sur le marché B2B se joue sur l'intégration et le ROI démontré, pas sur les benchmarks, et la chute des prix change vraiment les calculs dans les DSI qui hésitaient. Je retiens surtout ça : OpenAI est en train de devenir un cabinet de conseil déguisé en startup.

BusinessActu
1 source
Les 16 meilleurs outils IA génératives pour le code en 2026 : comparatif et cas d'usage
673MarkTechPost 

Les 16 meilleurs outils IA génératives pour le code en 2026 : comparatif et cas d'usage

En 2026, les outils de génération de code alimentés par l'intelligence artificielle ont profondément transformé la manière dont les développeurs construisent des logiciels. Ce qui n'était, il y a quelques années, qu'un simple système d'autocomplétion ligne par ligne est devenu une infrastructure capable de générer des applications entières, des pipelines multi-agents et des interfaces en langage naturel pour des bases de code complexes. Parmi les seize outils recensés cette année, plusieurs se démarquent nettement. Atoms se positionne comme une plateforme qui transforme une description en langage naturel en application déployable complète, avec frontend, backend, base de données, authentification et paiements Stripe intégrés via Atoms Cloud. Son mode Race Mode permet de faire tourner plusieurs modèles ou équipes d'agents en parallèle sur le même prompt pour comparer les résultats. GitHub Copilot, développé par GitHub et OpenAI, reste l'assistant le plus utilisé avec ses suggestions en temps réel dans VS Code, Visual Studio et JetBrains, désormais enrichies de modes agents pour les modifications multi-fichiers. Tabnine mise sur la confidentialité en permettant aux équipes de faire tourner les modèles sur leur propre infrastructure. Replit offre un environnement de développement cloud complet avec déploiement intégré, tandis que Warp modernise le terminal en traduisant le langage naturel en commandes shell exécutables. L'impact de ces outils est concret et immédiat pour les ingénieurs logiciels, les data scientists et les développeurs indépendants. Ils réduisent drastiquement le temps de prototypage, éliminent les tâches répétitives d'infrastructure et abaissent la barrière d'entrée pour lancer des produits numériques. Des plateformes comme Atoms ou Replit permettent aujourd'hui de passer d'une idée à une application fonctionnelle en quelques heures sans configuration locale, ce qui modifie structurellement les coûts de développement et la vitesse de mise sur le marché pour les startups comme pour les grandes entreprises. Hugging Face, de son côté, reste une ressource centrale pour les équipes qui souhaitent s'appuyer sur des modèles open source pour l'autocomplétion, la refactorisation ou l'explication de code, sans dépendre de solutions propriétaires. Ce mouvement s'inscrit dans une évolution rapide du marché depuis l'émergence des grands modèles de langage entraînés sur du code, notamment GPT-4, Gemini et les modèles spécialisés comme StarCoder. La concurrence s'est intensifiée entre solutions propriétaires et open source, entre outils intégrés à l'éditeur et plateformes autonomes de génération d'applications. Les enjeux portent désormais sur la confidentialité des données, la qualité du code produit, l'intégration dans les workflows existants et la capacité à gérer des projets de grande envergure. La prochaine phase d'évolution semble pointer vers des agents capables de gérer l'intégralité du cycle de vie logiciel, de la conception à la maintenance, avec une intervention humaine réduite à la validation.

UEHugging Face, entreprise française, est identifiée comme ressource centrale pour les équipes souhaitant s'appuyer sur des modèles open source sans dépendance aux solutions propriétaires américaines.

OutilsOutil
1 source
DICT et Google Cloud déployent l’IA et la cybersécurité dans l’État philippin
674Le Big Data 

DICT et Google Cloud déployent l’IA et la cybersécurité dans l’État philippin

Le ministère philippin des Technologies de l'information et de la communication (DICT) a annoncé en juin 2026 une extension majeure de son partenariat avec Google Cloud, portant sur le déploiement de l'intelligence artificielle dans les administrations publiques et le renforcement de la cybersécurité nationale. Le programme prévoit d'équiper plus de 200 000 fonctionnaires d'outils basés sur Gemini Enterprise sur les 18 prochains mois, avec une première vague de 50 000 agents publics déjà ciblés. Ces outils sont accessibles via l'eMarketplace gouvernemental, lancé au premier trimestre 2026. En parallèle, le Bureau de la cybersécurité du DICT a constitué une alliance interministérielle de cyberdéfense reposant sur Google Cloud Cybershield, une plateforme combinant renseignement sur les menaces, analyse par Gemini et expertise de Mandiant, hébergée au sein du National Security Operations Center. À fin juin 2026, 90 agences gouvernementales devaient être couvertes par ce dispositif, contre 56 déjà formées au moment de l'annonce. L'impact de cette initiative est particulièrement concret pour un archipel de plus de 7 000 îles où l'accès aux services publics reste inégal. Les agents conversationnels en cours de déploiement permettront aux citoyens d'obtenir des réponses dans leur langue locale sur des procédures aussi diverses que la création d'entreprise, les services de santé ou les aides en cas de catastrophe naturelle, sans avoir à naviguer entre plusieurs administrations. Pour les fonctionnaires, l'IA accélère la recherche documentaire, l'analyse de dossiers et la coordination interministérielle, réduisant la friction bureaucratique qui ralentit traditionnellement l'action publique. Sur le volet cybersécurité, la centralisation de la surveillance au sein du NSOC renforce la résilience des infrastructures critiques à mesure que les services publics se numérisent, un enjeu d'autant plus sensible que les Philippines accueillent les sommets de l'ASEAN tout au long de l'année 2026. Ce partenariat s'inscrit dans une dynamique plus large de numérisation accélérée des États d'Asie du Sud-Est, où Google Cloud multiplie les accords avec les gouvernements pour positionner ses outils au cœur des réformes administratives. Pour les Philippines, le programme « AI Agents for the Public Sector » représente un pari sur la capacité de l'IA à compenser les déficits d'infrastructure humaine dans un pays où la dispersion géographique complique la prestation de services uniformes. La réussite du déploiement dépendra en grande partie de l'adoption réelle par les fonctionnaires et de la robustesse de la connectivité dans les régions isolées, deux défis que le DICT reconnaît implicitement en faisant du développement d'infrastructures adaptées à l'ère de l'IA un troisième axe de la collaboration. Si les résultats sont au rendez-vous, ce modèle philippin pourrait servir de référence pour d'autres gouvernements cherchant à industrialiser rapidement leur transition vers l'IA publique.

InfrastructureOpinion
1 source
Qu’est ce qu’un Prompt IA ? Comment en réaliser un pertinent et comment le maintenir à jour ?
675Frandroid 

Qu’est ce qu’un Prompt IA ? Comment en réaliser un pertinent et comment le maintenir à jour ?

Le terme « prompt » s'est imposé comme le vocabulaire incontournable de l'intelligence artificielle générative, sans que sa définition soit toujours clairement posée. Un prompt désigne l'instruction textuelle qu'un utilisateur soumet à un modèle d'IA pour obtenir une réponse : une question, une consigne, un contexte ou une combinaison des trois. Sa qualité détermine directement la pertinence du résultat produit par des outils comme ChatGPT, Claude ou Gemini. Plus l'instruction est précise, structurée et contextualisée, plus la réponse générée sera utile et adaptée au besoin réel. Maîtriser l'art du prompt devient un avantage concret pour les professionnels qui intègrent l'IA dans leur quotidien. Un prompt efficace précise le rôle attendu du modèle, le format de sortie souhaité, le niveau de détail et l'audience cible. L'absence de ces éléments produit des réponses génériques, vagues ou hors sujet, ce qui oblige à multiplier les échanges et réduit le gain de productivité escompté. À l'inverse, une instruction bien construite peut transformer un outil généraliste en assistant expert adapté à un métier ou une tâche précise. La pratique du prompting n'est pas figée : les modèles évoluent régulièrement, leurs capacités changent, et les prompts qui fonctionnaient bien il y a six mois peuvent devenir sous-optimaux après une mise à jour. Il est donc recommandé de documenter ses prompts les plus utiles, de les tester à intervalles réguliers et de les ajuster en fonction des nouvelles versions des modèles. Cette discipline, parfois appelée « prompt engineering », commence à faire l'objet de formations et de rôles dédiés au sein des entreprises.

💬 Le prompt engineering s'officialise en formation et en poste RH, et c'est le vrai signal ici : l'IA générative est sortie du laboratoire. La vraie compétence, c'est moins de savoir coller un rôle et un format dans un prompt que de comprendre ce qu'un modèle peut vraiment faire ou pas (ça, l'article passe vite dessus). Documenter et versionner ses prompts comme du code, par contre, c'est du bon sens qu'on applique encore trop rarement.

OutilsTuto
1 source
Weis Markets adopte les chariots intelligents d'Instacart dans ses magasins
676AI News 

Weis Markets adopte les chariots intelligents d'Instacart dans ses magasins

Weis Markets, chaîne de supermarchés basée en Pennsylvanie avec 199 magasins, déploie les chariots intelligents Caper Carts d'Instacart dans plusieurs de ses points de vente. Ces chariots embarquent des caméras orientées vers le panier, des balances certifiées, des systèmes de géolocalisation et un écran tactile. Leur logiciel repose sur de l'IA entraînée sur plus de 1,6 milliard de commandes en ligne, combinée à du calcul embarqué sur l'appareil. Les clients peuvent suivre leurs dépenses en temps réel, accéder à des coupons géolocalisés, se connecter à leur compte Weis Rewards pour cumuler des avantages fidélité, et consulter une fonction "Buy It Again" qui affiche leurs achats habituels. Greg Zeh, directeur des systèmes d'information de Weis, présente ces chariots comme un moyen de fluidifier l'expérience en rayon tout en connectant les données du magasin physique à celles de la vente en ligne. Ce déploiement illustre l'accélération d'Instacart sur le segment des magasins connectés, après une période centrée sur la livraison à domicile. Les Caper Carts sont désormais présents dans plus de 100 villes, répartis dans 15 États américains, chez une douzaine d'enseignes dont Kroger, Schnucks et les bannières Wakefern comme ShopRite et Fairway Market. Des données opérationnelles commencent à émerger : chez Schnucks, un magasin équipé de seulement 10 chariots intelligents pour 160 classiques a vu ces derniers traiter plus de 10 % des ventes lors des journées chargées, selon Retail Dive. Pour les distributeurs, l'enjeu est double : améliorer l'expérience client tout en capturant des données comportementales en magasin jusqu'ici inaccessibles. Weis ne mise pas uniquement sur les chariots : en décembre 2025, la chaîne a finalisé le déploiement du système ELERA Security Suite de Toshiba sur les caisses libre-service de l'ensemble de ses 199 magasins, avec reconnaissance des fruits et légumes et outils anti-démarque inconnue basés sur l'IA embarquée. Plus de 94 % des clients ont utilisé la fonction de reconnaissance des produits. En parallèle, Albertsons, qui exploite plus de 2 000 magasins sous les enseignes Safeway, Jewel-Osco et ACME, a développé en interne un outil de contrôle qualité par vision artificielle pour détecter les fruits abîmés ou moisis avant leur mise en rayon, en commençant par les fraises et les raisins. Ce système, construit sur la plateforme Google Cloud Gemini Enterprise avec Vision AI, vise à standardiser les inspections dans les centres de distribution. La grande distribution américaine engage ainsi une transformation profonde de ses opérations, en intégrant l'IA à chaque étape de la chaîne, du centre logistique jusqu'au chariot du client.

OutilsOutil
1 source
Google lance Dreambeans, cette appli IA crée des petites histoires basées sur votre vie
677Le Big Data 

Google lance Dreambeans, cette appli IA crée des petites histoires basées sur votre vie

Google a lancé le 3 juin 2026 Dreambeans, une application mobile expérimentale développée par Google Labs qui génère chaque matin entre 10 et 14 histoires personnalisées à partir des données de l'utilisateur. Pendant la nuit, l'application analyse le contenu de Gmail, Google Agenda, Google Photos, YouTube et l'historique de recherche pour produire des récits illustrés par intelligence artificielle. Ces histoires peuvent prendre la forme d'une recommandation de café détectée dans les recherches récentes, d'informations liées à un voyage planifié dans l'agenda, ou d'idées inspirées des vidéos regardées sur YouTube. Certains récits vont jusqu'à proposer une action concrète, comme réserver une place pour un événement. Les illustrations sont générées grâce au modèle Nano Banana 2 de Google, et peuvent intégrer les visages de l'utilisateur ou de ses proches en s'appuyant sur le regroupement facial de Google Photos. Pour l'instant, l'application est réservée aux abonnés Google AI Ultra résidant aux États-Unis et âgés d'au moins 18 ans. L'application incarne une philosophie délibérément opposée au modèle dominant des réseaux sociaux : au lieu d'un flux infini conçu pour maximiser le temps passé sur l'écran, Dreambeans propose une poignée d'histoires quotidiennes puis encourage l'utilisateur à reprendre sa journée. Cette approche pourrait résonner auprès d'utilisateurs de plus en plus critiques envers les mécaniques addictives des plateformes classiques. En pratique, l'impact reste cependant très circonscrit : l'accès est conditionné à un abonnement Google AI Ultra facturé 100 dollars par mois, soit l'offre la plus coûteuse de Google, ce qui réduit considérablement le nombre d'utilisateurs potentiels à court terme. Google reconnaît par ailleurs que l'application reste un projet expérimental, avec des recommandations parfois peu pertinentes et des visuels qui peuvent s'avérer inexacts. Dreambeans s'inscrit dans la stratégie plus large de Google autour de ce qu'il appelle l'"intelligence personnelle", soit la capacité à croiser les données des différents services Google pour offrir une expérience hyper-contextualisée. L'application arrive dans un moment où les géants technologiques cherchent à valoriser leurs écosystèmes fermés face à la concurrence de nouveaux entrants en IA. La question de la vie privée est centrale : Google indique que les utilisateurs contrôlent quels services sont connectés à Dreambeans et peuvent effacer leurs données à tout moment, et que les paramètres de l'appli n'influencent pas Gemini ni le mode IA de Google. Un système de retour d'expérience est intégré pour affiner les résultats. La prochaine étape sera de déterminer si ce positionnement, intime, limité, et payant, séduira au-delà du cercle des early adopters fortunés, ou si Google élargira progressivement l'accès à d'autres marchés.

OutilsOutil
1 source
Les meilleurs modèles de synthèse vocale en 2026 : comparaison par benchmarks
678MarkTechPost 

Les meilleurs modèles de synthèse vocale en 2026 : comparaison par benchmarks

La synthèse vocale par intelligence artificielle a connu une accélération spectaculaire en 2026, au point que la frontière entre voix humaine et voix synthétique est devenue difficile à percevoir. Les deux références de l'industrie pour comparer ces modèles sont le classement Artificial Analysis Speech Arena, qui attribue un score ELO basé sur les préférences humaines en aveugle, et le TTS Arena de Hugging Face, qui fonctionne sur le même principe de vote A/B. Au 30 mai 2026, le top 5 de l'Artificial Analysis Speech Arena est occupé par Gemini 3.1 Flash TTS de Google, Realtime TTS-2 d'Inworld (en Research Preview), Sonic 3.5, Realtime TTS 1.5 Max et Fun-Realtime-TTS-Preview. Parmi les acteurs les plus remarquables, Inworld AI, un laboratoire fondé par des anciens de Google et DeepMind, a lancé TTS-1.5 le 21 janvier 2026, suivi de Realtime TTS-2 plus tard dans l'année. Son modèle propose deux niveaux : Mini, optimisé pour la latence avec un temps avant premier audio inférieur à 130 millisecondes au 90e percentile, et Max, sous 250 millisecondes. La tarification va de 25 dollars par million de caractères pour le Mini jusqu'à 5 dollars en offre Enterprise. Google DeepMind, de son côté, a publié Gemini 3.1 Flash TTS le 15 avril 2026, accessible via l'API Gemini, AI Studio et Vertex AI. Ces évolutions ont des implications directes pour les développeurs et les entreprises qui intègrent la voix dans leurs produits. Une latence sous les 100 millisecondes est désormais atteignable pour certains systèmes temps réel, ce qui rend les agents vocaux réellement utilisables dans des contextes grand public, comme le service client automatisé ou les jeux vidéo. Inworld revendique 30 % de plage expressive supplémentaire et 40 % de stabilité en plus par rapport à sa génération précédente, deux critères critiques pour des applications qui ne peuvent se permettre ni monotonie ni erreurs de prononciation. Les tarifs agressifs, notamment l'offre Enterprise à 5 dollars le million de caractères, signalent une course vers la commoditisation du TTS, similaire à ce que le marché des LLM a vécu entre 2023 et 2025. La comparaison entre modèles reste néanmoins complexe, car aucun benchmark ne capture l'ensemble des dimensions pertinentes. La qualité perçue, le taux d'erreur de caractères mesuré par méthode aller-retour (transcription ASR puis comparaison avec l'entrée), la latence de queue et la couverture linguistique obéissent à des logiques distinctes. Inworld couvre 15 langues pour TTS-1.5 mais plus de 100 pour TTS-2, tandis que les classements ELO fluctuent d'une semaine à l'autre. L'enjeu pour les équipes produit est d'identifier l'axe non négociable de leur application, qu'il s'agisse de la latence pour un assistant vocal ou de la fidélité phonétique pour un usage éditorial, avant de choisir leur fournisseur dans un marché qui reste en recomposition permanente.

💬 Le TTS vit ce que les LLM ont traversé entre 2023 et 2025. 5 dollars le million de caractères en Enterprise chez Inworld, Gemini Flash TTS qui s'installe en tête des classements, la course vers la commoditisation est enclenchée et ça va aller vite. La vraie nouveauté, c'est la latence sous 100ms qui rend enfin les agents vocaux utilisables en vrai, pas juste en démo.

CréationOutil
1 source
Construire un agent IA avancé avec planification, appel d'outils, mémoire et auto-critique via l'OpenAI API
679MarkTechPost 

Construire un agent IA avancé avec planification, appel d'outils, mémoire et auto-critique via l'OpenAI API

Un tutoriel publié sur la plateforme de notebooks Colab détaille comment construire un système d'IA agentique avancé en s'appuyant sur l'API OpenAI et le modèle GPT-5.2. L'architecture proposée repose sur un pipeline de trois rôles spécialisés et distincts : un planificateur qui décompose les objectifs complexes en étapes, un exécuteur qui mobilise des outils concrets pour agir, et un critique qui évalue la qualité des résultats avant de les valider. Quatre outils sont intégrés directement dans le système : une calculatrice sécurisée qui accepte uniquement des expressions numériques sans variables, un moteur de recherche dans une base de connaissances interne simulant des playbooks d'équipe, un extracteur JSON pour produire des sorties structurées, et un module d'écriture de fichiers qui sauvegarde les livrables finaux avec une empreinte SHA-256 de vérification. La clé API est transmise via getpass() pour éviter toute exposition dans le code ou les sorties du notebook. Cette approche modulaire représente un changement de paradigme dans la façon de concevoir des agents IA. En séparant strictement la stratégie, l'action et le contrôle qualité en trois couches distinctes, le système évite les dérives courantes des agents monolithiques qui mélangent raisonnement et exécution sans garde-fous. Le composant critique intégré permet une autocorrection systématique avant la réponse finale, ce qui réduit les hallucinations et améliore la fiabilité des sorties dans des contextes professionnels. Pour les développeurs et les entreprises qui cherchent à automatiser des workflows complexes (rédaction de comptes-rendus de réunion, traitement de données structurées, génération de rapports), ce type d'architecture offre une robustesse que les chatbots conversationnels classiques ne peuvent pas atteindre. Ce tutoriel s'inscrit dans une vague plus large d'intérêt pour les systèmes multi-agents et les architectures dites "agentic", portées notamment par les travaux d'Anthropic sur Claude, de Google avec Gemini, et d'OpenAI elle-même avec ses API d'assistants et de function calling. L'émergence de GPT-5.2, le modèle utilisé ici, illustre la rapidité avec laquelle les capacités de base progressent et rendent ces architectures accessibles à un plus grand nombre de développeurs. La tendance de fond est claire : les LLM cessent d'être de simples générateurs de texte pour devenir des orchestrateurs capables de planifier, d'agir sur des systèmes externes et de s'autocorriger, ce qui rapproche concrètement l'IA générative des promesses d'automatisation avancée que l'industrie promet depuis plusieurs années.

OutilsTuto
1 source
Les techniques de distillation des LLM expliquées
680MarkTechPost 

Les techniques de distillation des LLM expliquées

La distillation de modèles de langage s'est imposée comme l'une des techniques les plus stratégiques du secteur de l'IA. Le principe repose sur l'utilisation d'un grand modèle "enseignant" pour entraîner un modèle "élève" plus petit et plus efficace, plutôt que de se limiter aux textes bruts issus d'internet. Meta a ainsi utilisé son modèle Llama 4 Behemoth pour entraîner Llama 4 Scout et Llama 4 Maverick. Google a eu recours à ses modèles Gemini lors du développement de Gemma 2 et Gemma 3. DeepSeek, de son côté, a distillé les capacités de raisonnement de DeepSeek-R1 vers des modèles plus légers basés sur Qwen et Llama 3.1. Trois grandes méthodes structurent cette discipline : la distillation par labels souples, où l'élève apprend à reproduire la distribution de probabilités complète de l'enseignant token par token ; la distillation par labels durs, où l'élève imite uniquement la réponse finale générée ; et la co-distillation, où plusieurs modèles apprennent en parallèle en partageant leurs prédictions. Ces techniques permettent à des modèles plus compacts d'hériter de capacités avancées, raisonnement, suivi d'instructions, génération structurée, à un coût computationnel bien inférieur à celui d'un entraînement from scratch. La distillation par labels souples est la plus riche informationnellement : en exposant l'élève à l'ensemble de la distribution de probabilités (par exemple "chat" = 70 %, "chien" = 20 %, "animal" = 10 %), elle lui transmet ce que les chercheurs appellent la "dark knowledge" du modèle, c'est-à-dire les relations sémantiques implicites entre les tokens. En revanche, elle exige un accès aux logits internes du modèle enseignant, impossible avec les modèles propriétaires, et génère des coûts de stockage massifs sur des vocabulaires de 100 000 tokens ou plus. La distillation par labels durs, utilisée notamment par DeepSeek, est plus simple : le modèle enseignant génère des données synthétiques que l'élève apprend à reproduire via un apprentissage supervisé classique, sans accès aux probabilités internes. Ces choix techniques reflètent des enjeux industriels profonds. Dans un contexte où entraîner un grand modèle coûte des dizaines à des centaines de millions de dollars, la distillation représente un levier de démocratisation : elle permet aux équipes disposant de ressources limitées de produire des modèles compétitifs en exploitant la puissance de modèles déjà entraînés. Elle soulève aussi des questions sur la propriété intellectuelle, distiller un modèle fermé à partir de ses sorties publiques se situe dans une zone juridique encore floue. Enfin, la co-distillation, où plusieurs modèles s'entraînent mutuellement, ouvre la voie à des architectures d'apprentissage collaboratif qui pourraient redéfinir la façon dont les prochaines générations de modèles sont construites.

LLMsPaper
1 source
BalCapRL : un cadre équilibré pour le sous-titrage d'images par apprentissage par renforcement dans les MLLM
681Apple Machine Learning 

BalCapRL : un cadre équilibré pour le sous-titrage d'images par apprentissage par renforcement dans les MLLM

Des chercheurs ont présenté BalCapRL, un nouveau cadre d'entraînement par apprentissage par renforcement (RL) conçu pour améliorer la génération automatique de légendes d'images par les grands modèles de langage multimodaux (MLLM). Face aux limites des méthodes RL existantes, BalCapRL cherche à équilibrer plusieurs dimensions de qualité simultanément dans la description d'images, une tâche considérée comme fondamentale en vision par ordinateur et qui a gagné en importance avec l'essor des MLLM. Les approches RL actuelles pour la génération de légendes souffrent d'un défaut structurel : en optimisant une métrique unique orientée utilité, elles produisent des descriptions trop longues, bruitées ou carrément hallucinées. Ces travers ont des conséquences concrètes pour les applications industrielles qui dépendent de légendes fiables, comme l'accessibilité numérique, l'indexation d'images ou les moteurs de recherche visuelle. BalCapRL propose un cadre plus équilibré qui préserve plusieurs critères de qualité en même temps, évitant les compromis indésirables qu'introduisent les métriques d'évaluation trop étroites. La génération de légendes d'images a connu un regain d'intérêt avec l'essor de modèles comme GPT-4V, LLaVA ou Gemini, capables de décrire des scènes visuelles en langage naturel. L'application du RL à ces modèles, popularisée par les travaux sur le RLHF dans les LLM textuels, est devenue une piste prometteuse mais difficile à maîtriser. BalCapRL s'inscrit dans cette dynamique en cherchant à corriger les biais induits par des objectifs d'optimisation trop réducteurs, un enjeu central pour l'alignement des modèles multimodaux à mesure qu'ils s'imposent dans les usages professionnels.

RecherchePaper
1 source
De la localisation à la fonction : évaluation de l'intelligence spatiale et fonctionnelle des LLM multimodaux
682Apple Machine Learning 

De la localisation à la fonction : évaluation de l'intelligence spatiale et fonctionnelle des LLM multimodaux

Des chercheurs ont publié SFI-Bench (Spatial-Functional Intelligence Benchmark), un nouveau cadre d'évaluation conçu pour tester une forme plus avancée d'intelligence spatiale chez les grands modèles de langage multimodaux. Le benchmark comprend plus de 1 700 questions tirées de vidéos égocentrées d'intérieurs domestiques filmées sous différents angles, couvrant des environnements variés du quotidien. Contrairement aux benchmarks existants comme VSI-Bench, SFI-Bench ne se contente pas de demander aux modèles où se trouvent les objets, mais cherche à évaluer s'ils comprennent à quoi ces objets servent dans leur contexte réel. Cette distinction est fondamentale pour le développement d'agents IA capables d'agir dans le monde physique. Un robot ou un assistant visuel qui sait qu'une tasse est posée sur la table, mais ne comprend pas qu'elle sert à boire, sera incapable de planifier des actions cohérentes dans un environnement domestique. SFI-Bench cible précisément ce niveau cognitif supérieur, appelé intelligence fonctionnelle, qui conditionne l'autonomie réelle des agents multimodaux dans des tâches de robotique domestique, d'assistance aux personnes ou de navigation intelligente. La course aux benchmarks spatiaux s'est accélérée ces deux dernières années, à mesure que les modèles comme GPT-4o, Gemini et les LLM open-source progressaient en perception visuelle. Les évaluations géométriques de base ne suffisent plus à différencier les systèmes les plus capables. SFI-Bench s'inscrit dans un effort plus large de la communauté pour définir des critères d'évaluation alignés sur des usages concrets, et pourrait devenir une référence incontournable pour mesurer la maturité des agents embarqués ou des assistants visuels de prochaine génération.

RecherchePaper
1 source
AutoSpatial : raisonnement vision-langage pour la navigation sociale des robots humanoïdes par apprentissage spatial efficace
683arXiv cs.RO 

AutoSpatial : raisonnement vision-langage pour la navigation sociale des robots humanoïdes par apprentissage spatial efficace

Une équipe de recherche a publié AutoSpatial (arXiv:2503.07557), une méthode destinée à améliorer la capacité des modèles de vision-langage (VLM) à raisonner dans l'espace pour la navigation sociale des robots, c'est-à-dire la capacité d'un robot à se déplacer en présence d'humains de façon naturelle et sûre. La technique combine une supervision manuelle minimale avec un étiquetage automatique à grande échelle de paires de questions-réponses visuelles (VQA). Un protocole d'entraînement en deux rounds hiérarchiques permet au modèle d'acquérir à la fois une compréhension globale d'une scène et une analyse fine des détails. L'évaluation a mobilisé trois juges LLM (GPT-4o, Gemini 2.0 Flash et Claude 3.5 Sonnet) en validation croisée, complétés par des évaluateurs humains. Les gains mesurés sur les bases de référence sont de +10,71% en perception et prédiction, +16,26% en raisonnement, +20,50% en sélection d'action et +18,73% en capacité d'explication, par rapport à des modèles entraînés uniquement sur données annotées manuellement. Le résultat le plus pertinent pour les intégrateurs et les décideurs industriels est celui sur l'action : +20,50%, qui est le composant directement lié au comportement réel du robot. Le goulot d'étranglement classique de la navigation sociale reste l'annotation manuelle, coûteuse et peu scalable. AutoSpatial propose une voie d'auto-étiquetage qui réduit significativement ce frein, ce qui ouvre la possibilité de monter en volume de données sans exploser les coûts. Cela renforce également l'hypothèse que les VLA (Vision-Language-Action models) peuvent progresser par la donnée synthétique plutôt que par la seule supervision humaine. Un point de prudence méthodologique : les scores de performance sont évalués par d'autres LLM, ce qui introduit un biais circulaire potentiel que l'article ne discute pas en profondeur. La navigation sociale est un problème ouvert depuis plusieurs années, au croisement de la robotique de service et des modèles fondation. Les VLM ont montré des lacunes persistantes en raisonnement spatial, notamment pour estimer des distances, anticiper les trajectoires humaines ou interpréter des scènes encombrées. AutoSpatial s'inscrit dans une dynamique plus large incluant des travaux comme RT-2, OpenVLA ou le récent GR00T N2 de NVIDIA, qui cherchent tous à injecter du raisonnement langagier dans la boucle de contrôle robot. La méthode présentée reste pour l'instant un résultat de recherche sans déploiement terrain annoncé. Les prochaines étapes naturelles seraient une validation dans des environnements réels peuplés et une comparaison directe avec des architectures VLA de type diffusion comme Pi-0 de Physical Intelligence.

RobotiqueActu
1 source
Migrer un agent texte vers un assistant vocal avec Amazon Nova 2 Sonic
684AWS ML Blog 

Migrer un agent texte vers un assistant vocal avec Amazon Nova 2 Sonic

Amazon a publié un guide technique détaillé sur la migration d'agents textuels vers des assistants vocaux en utilisant Amazon Nova 2 Sonic, son modèle de traitement de la parole en temps réel. L'article, publié en avril 2026, s'adresse aux équipes d'ingénierie qui ont déjà déployé des agents conversationnels textuels et souhaitent les adapter à des interfaces vocales. Les secteurs visés sont larges : finance, santé, éducation, réseaux sociaux et commerce de détail, tous confrontés à une demande croissante d'interactions orales naturelles et instantanées. Amazon propose même un outil intégré dans des IDE comme Kiro et Claude Code, capable de convertir automatiquement un agent textuel en agent vocal à partir d'un référentiel de code existant. La différence entre un agent texte et un agent vocal est bien plus profonde qu'il n'y paraît, et c'est là l'enjeu central du guide. Un agent textuel peut retourner des tableaux, des listes à puces et des liens cliquables, le tout en une seule réponse que l'utilisateur lit à son rythme. Un agent vocal doit fonctionner différemment : les réponses doivent être courtes, séquentielles, avec des confirmations intermédiaires. Exemple concret : là où l'agent textuel d'une banque affiche un récapitulatif complet de trois comptes en une fois, l'agent vocal annonce un compte, demande si l'utilisateur veut continuer, puis présente le suivant. La latence devient également un critère critique : quelques secondes d'attente sont tolérables à l'écrit, mais créent une impression de coupure à l'oral, où chaque appel d'outil ajoute un silence perceptible. Cela oblige à repenser l'architecture en profondeur : streaming audio bidirectionnel permanent, détection d'activité vocale, gestion des interruptions en cours de phrase, et traitement asynchrone des outils pour ne pas bloquer le flux. Cette publication intervient alors que les grandes plateformes cloud cherchent à démocratiser la voix comme interface standard pour les applications d'entreprise. Amazon Nova 2 Sonic s'inscrit dans une compétition directe avec des modèles comme GPT-4o Audio d'OpenAI et Gemini Live de Google, tous capables de traitement vocal en temps réel avec de faibles temps de latence. La migration vers la voix soulève des enjeux techniques considérables, notamment la gestion des tours de parole fluides, la réduction des délais lors des appels à des API externes, et l'adaptation des prompts système pour un style oral plutôt qu'écrit. Le fait qu'Amazon intègre un outil de conversion automatique dans les IDE suggère que l'entreprise veut abaisser le seuil d'entrée pour accélérer l'adoption, tout en conservant une dépendance à son écosystème cloud pour l'inférence et le déploiement.

OutilsOutil
1 source
L'évolution des encodeurs : des modèles simples à l'IA multimodale
685AI News 

L'évolution des encodeurs : des modèles simples à l'IA multimodale

Les systèmes d'intelligence artificielle que nous utilisons chaque jour, des moteurs de recherche aux chatbots en passant par la détection de fraude bancaire, reposent tous sur une technologie rarement évoquée : les encodeurs. Ces composants agissent comme des traducteurs, convertissant l'information brute du monde réel (texte, images, sons) en représentations mathématiques que les machines peuvent traiter. Dans les années 1990 et 2000, cette conversion était entièrement manuelle : les développeurs décidaient eux-mêmes comment représenter chaque donnée. Un système de recommandation e-commerce pouvait catégoriser des chaussures de running comme "sport", mais ne pouvait établir de lui-même le lien avec les montres connectées ou les gourdes, sauf si ce lien avait été explicitement programmé. Les machines traitaient des chiffres, pas du sens. Tout a changé avec l'avènement des réseaux de neurones, qui ont permis aux encodeurs d'apprendre à partir des données plutôt que de suivre des règles fixes. Entraîné sur des milliers d'images de chats, un système identifie progressivement les oreilles, les moustaches, la queue, sans qu'aucun ingénieur ne lui ait décrit ces caractéristiques. Appliqué au langage, ce principe a conduit à la représentation des mots sous forme de vecteurs mathématiques capturant leur signification : c'est pourquoi Google comprend aujourd'hui que "vols pas chers" et "billets d'avion économiques" renvoient au même besoin. Une étape supplémentaire a été franchie avec les autoencodeurs, conçus pour comprimer l'information puis la reconstruire, forçant le modèle à identifier l'essentiel. Cette approche est désormais au cœur des systèmes anti-fraude des banques : un encodeur apprend ce qu'est une transaction "normale" et signale automatiquement toute anomalie, comme un achat à l'étranger inhabituellement élevé, sans avoir été programmé pour ce cas précis. La véritable rupture est venue avec les modèles Transformer, apparus à partir de 2017. Contrairement à leurs prédécesseurs qui traitaient l'information séquentiellement, ces architectures analysent la totalité d'une phrase ou d'une image en une seule passe, en pondérant dynamiquement quels éléments sont les plus pertinents. Face à l'ambiguïté de "Elle a vu l'homme avec le télescope", un encodeur Transformer analyse l'ensemble du contexte pour proposer l'interprétation la plus cohérente, là où les anciens modèles échouaient. Ces encodeurs alimentent aujourd'hui les assistants vocaux, les outils de traduction en ligne, les systèmes de recommandation de Netflix ou Spotify. L'étape suivante, déjà engagée dans des modèles comme CLIP ou Gemini, consiste à unifier texte, image, audio et vidéo dans un même espace de représentation : les encodeurs multimodaux, qui permettent à une IA de relier une photo, une description et un son comme le ferait un être humain.

LLMsPaper
1 source
686The Verge AI 

Yelp rend son chatbot IA bien plus utile

Yelp vient d'annoncer une refonte majeure de son assistant chatbot, baptisé Yelp Assistant, avec l'ambition de transformer la plateforme en véritable concierge numérique. Selon le communiqué officiel de l'entreprise, le bot sera désormais placé "au centre de l'expérience applicative", capable de répondre à des questions, formuler des recommandations personnalisées et gérer des réservations au sein d'une seule et même conversation. Cette mise à jour s'inscrit dans une série d'évolutions axées sur l'IA que Yelp déploie depuis plusieurs mois. L'enjeu est de taille : faire passer l'IA d'un rôle purement informatif à un rôle d'action concrète. Plutôt que de simplement lire des avis, l'utilisateur peut désormais accomplir une tâche complète sans quitter l'application. Pour Yelp, dont le modèle repose sur des millions d'avis générés par les utilisateurs, c'est aussi une façon de monétiser autrement cette base de données unique en guidant l'utilisateur jusqu'à la réservation finale. Cette initiative reflète une tendance plus large dans l'industrie tech : les plateformes à forte base de données propriétaires cherchent à transformer leur actif en avantage compétitif face aux assistants IA généralistes comme ChatGPT ou Google Gemini. Yelp, qui reste une référence aux États-Unis pour les avis locaux sur les restaurants et commerces, mise sur la profondeur de ses données de contexte local pour se différencier. La prochaine étape sera de voir si les utilisateurs adoptent réellement ce mode de navigation conversationnel plutôt que la recherche classique.

OutilsOutil
1 source
687Ahead of AI 

Mon approche pour comprendre les architectures de LLM

Sebastian Raschka, chercheur et auteur reconnu dans le domaine de l'apprentissage automatique, a publié un article détaillant sa méthode de travail pour comprendre et visualiser les architectures des grands modèles de langage (LLM). Sa démarche, qu'il applique pour produire les schémas et dessins publiés dans ses articles et sa LLM-Gallery, part toujours des rapports techniques officiels, avant de plonger dans les fichiers de configuration et les implémentations de référence disponibles sur Hugging Face. Concrètement, lorsque les poids d'un modèle sont accessibles sur le Model Hub et que le modèle est supporté par la bibliothèque Python transformers, il est possible d'inspecter directement le fichier config.json et le code source pour obtenir des informations précises sur l'architecture, là où les articles scientifiques restent souvent vagues. Cette approche répond à un problème croissant : les publications académiques des laboratoires industriels sont de moins en moins détaillées sur le plan technique, en particulier pour les modèles open-weight. En s'appuyant sur le code de référence plutôt que sur les papiers, on accède à une vérité que le code ne peut pas dissimuler. Cette méthode permet à quiconque, chercheur, ingénieur ou passionné, de reconstituer fidèlement l'architecture d'un modèle comme LLaMA, Mistral ou Qwen, sans dépendre de descriptions parfois incomplètes ou ambiguës. En revanche, elle ne s'applique pas aux modèles propriétaires comme ChatGPT, Claude ou Gemini, dont les poids et les détails d'implémentation restent confidentiels. Le processus reste volontairement manuel. Raschka insiste sur ce point : même si certaines étapes pourraient être automatisées, réaliser cet exercice à la main reste l'une des meilleures façons d'apprendre vraiment comment ces architectures fonctionnent. Dans un contexte où la complexité des LLM ne cesse de croître et où la transparence des laboratoires diminue, ce type de rétro-ingénierie pédagogique devient un outil précieux pour maintenir une compréhension technique rigoureuse de l'état de l'art. Raschka prévoit de documenter ce flux de travail de façon plus complète pour la communauté.

💬 Le code ment jamais, les papiers si. C'est exactement le problème que Raschka met le doigt dessus : les labos publient de moins en moins les vrais détails, et le seul moyen de savoir ce qui tourne vraiment sous le capot, c'est d'aller lire le config.json directement sur HuggingFace. La partie "volontairement manuel", bon, certains vont trouver ça old school, mais c'est probablement la seule façon de vraiment comprendre plutôt que de juste faire tourner un script.

LLMsTuto
1 source
688Le Big Data 

Ne supprimez pas vos réunions ! Elles sont votre meilleure protection face à l’IA

Alors que l'intelligence artificielle compresse le temps de production des tâches intellectuelles, réduisant des projets de plusieurs mois à quelques heures, une constante résiste : les réunions. Dan Sirk, directeur marketing travaillant simultanément pour deux entreprises grâce à ChatGPT, Gemini et Claude, produit plus vite, seul, à moindre coût. Pourtant, il identifie les réunions comme la limite concrète à son expansion : déjà une dizaine par semaine, son agenda serait saturé au-delà de trois entreprises. Cette observation illustre un phénomène documenté par le New York Times : l'IA ne réduit pas la charge globale de travail, elle la déplace vers la coordination humaine. La raison est structurelle. Plus l'IA génère d'options, de stratégies et de prototypes, plus les équipes doivent arbitrer, prioriser et s'aligner. Ces décisions ne peuvent pas être déléguées à des systèmes automatisés : présenter une idée, convaincre des collègues, rassurer un client, négocier un compromis, ces dimensions restent irréductiblement humaines. Les réunions deviennent ainsi le lieu où la production brute se transforme en décisions concrètes. Chez Salesforce, des employés cherchent à renforcer leurs liens clients au-delà des échanges automatisés, par l'écoute active et l'accompagnement émotionnel. Chez PolicyFly, l'IA a divisé par deux le temps d'intégration client, mais les réunions demeurent : les clients veulent être rassurés, poser des questions, valider leurs choix en direct. Ce phénomène prolonge une tendance identifiée dès 2017 par le National Bureau of Economic Research : l'automatisation augmente la valeur des compétences sociales. Plus les machines absorbent les tâches techniques, plus les postes exigeant de fortes interactions humaines se multiplient. L'IA de 2024-2026 amplifie cette dynamique à grande échelle. Dans les processus de recrutement des entreprises technologiques, les compétences techniques cèdent du terrain face à la capacité à proposer des idées pertinentes et à convaincre. Dans le conseil, les présentations sont en partie générées par l'IA, mais les consultants performants sont ceux qui comprennent les modes de décision de leurs clients, une connaissance qui s'acquiert en réunion. Loin d'être des espaces d'inefficacité à éliminer, les réunions deviennent le terrain où se joue la valeur ajoutée humaine dans un monde où la production est largement automatisée.

SociétéOpinion
1 source
689VentureBeat AI 

Des dirigeants de Google, dont Demis Hassabis, contestent les allégations d'une adoption inégale de l'IA en interne

Un post publié le 13 avril sur X par Steve Yegge, ancien ingénieur Google reconverti en directeur de l'ingénierie chez Sourcegraph, a déclenché une vive polémique dans la Silicon Valley. Yegge y relayait les propos d'un ami, ingénieur actuel chez Google, selon lesquels l'adoption interne de l'IA chez Google serait bien plus banale que ce que l'entreprise laisse entendre. Selon cette source anonyme, les équipes de Google suivraient une distribution classique : 20 % de refractaires à l'IA, 60 % d'utilisateurs intermédiaires cantonnés aux assistants de code basiques, et seulement 20 % d'ingénieurs véritablement engagés dans des workflows agentiques avancés. Le post a rapidement enflammé les réseaux, atteignant 4 500 likes, 458 commentaires et 1,9 million de vues en moins de 24 heures. L'ami en question aurait également affirmé que certains Googlers ne pouvaient pas utiliser Claude Code d'Anthropic, perçu en interne comme "l'ennemi", et que Gemini n'était pas encore à la hauteur pour les cas d'usage les plus avancés. La réaction du côté de Google a été immédiate et tranchante. Demis Hassabis, cofondateur et PDG de Google DeepMind, a répondu directement à Yegge : "Dis à ton ami de faire un vrai travail plutôt que de propager des absurdités. Ce post est complètement faux, du pur clickbait." Addy Osmani, directeur chez Google Cloud AI, a livré une réfutation plus détaillée, affirmant que "plus de 40 000 ingénieurs utilisent des outils de codage agentiques chaque semaine" et que les équipes ont accès à des modèles personnalisés, des CLIs et des MCPs maison. Il a précisé que les Googlers peuvent même utiliser les modèles d'Anthropic via Vertex AI, concluant que "Google est tout sauf dans la moyenne." L'ingénieure Jaana Dogan a abondé dans ce sens, décrivant un usage quasi continu des outils IA dans son environnement quotidien. L'écho considérable de ce débat s'explique en grande partie par le profil de Yegge : avec treize ans chez Google, des passages chez Amazon et Grab, il s'est construit au fil des années une réputation d'insider-outsider au franc-parler, dont les analyses circulent largement dans les milieux tech. Un mémo interne qu'il avait rédigé chez Google en 2011 avait fuité et fait le tour des médias spécialisés, lui conférant un statut particulier. La polémique s'inscrit dans un contexte plus large : alors que les grandes entreprises tech rivalisent de communication autour de leur adoption de l'IA, la question de ce qui se passe réellement derrière les portes devient un enjeu de crédibilité. Pour Google, dont Gemini est à la fois un produit stratégique et un outil interne, toute suggestion d'un usage tiède en interne touche directement à la cohérence de son discours public.

BusinessOpinion
1 source
STADLER réinvente le travail intellectuel dans une entreprise vieille de 230 ans
690OpenAI Blog 

STADLER réinvente le travail intellectuel dans une entreprise vieille de 230 ans

STADLER, entreprise vieille de 230 ans spécialisée dans les systèmes de tri et de gestion des déchets, a déployé ChatGPT auprès de 650 collaborateurs pour transformer leur façon de traiter l'information et de produire du contenu. L'initiative, menée en partenariat avec OpenAI, vise à automatiser les tâches répétitives à forte valeur cognitive — rédaction de documents, synthèse de rapports, recherche interne — afin de libérer du temps pour des activités à plus forte valeur ajoutée. Des gains de productivité mesurables ont déjà été observés dans plusieurs départements depuis le déploiement. L'enjeu est de taille pour une entreprise industrielle traditionnelle : intégrer des outils d'IA générative dans des processus métiers souvent rigides constitue un changement culturel autant que technologique. Pour les 650 employés concernés, cela représente une nouvelle façon de travailler au quotidien, avec des assistants IA capables de rédiger, résumer et structurer l'information en quelques secondes là où il fallait auparavant plusieurs heures. Le cas STADLER illustre une tendance de fond : les entreprises industrielles centenaires, longtemps considérées comme réfractaires à l'innovation numérique rapide, accélèrent désormais leur adoption de l'IA générative. OpenAI multiplie ce type de partenariats avec des entreprises B2B pour ancrer ChatGPT Enterprise dans les flux de travail réels, face à la concurrence de Microsoft Copilot et Google Gemini for Workspace. La prochaine étape pour STADLER sera probablement d'étendre ces usages à l'ensemble de la chaîne de valeur, de la conception à la relation client.

UEUne entreprise industrielle européenne de 650 salariés adopte ChatGPT Enterprise, illustrant l'accélération de l'IA générative dans le tissu industriel traditionnel du continent.

OutilsActu
1 source
AsgardBench : un benchmark pour la planification interactive ancrée dans la vision
691Microsoft Research 

AsgardBench : un benchmark pour la planification interactive ancrée dans la vision

Des chercheurs ont publié AsgardBench, un nouveau benchmark conçu pour évaluer la capacité des agents IA incarnés à adapter leurs plans d'action en temps réel en fonction de ce qu'ils observent visuellement. Le système repose sur 108 scénarios contrôlés répartis en 12 types de tâches, tous construits sur AI2-THOR, un environnement de simulation 3D interactif représentant des intérieurs domestiques. Concrètement, un agent reçoit une instruction ménagère — nettoyer une tasse, remplir un évier, éteindre une lumière — et doit proposer à chaque étape une séquence complète d'actions, dont seule la première s'exécute. Il reçoit ensuite une image mise à jour et un signal binaire (succès ou échec), puis doit réviser son plan en conséquence. Ce qui rend le benchmark exigeant : les objets peuvent se trouver dans des états variables (tasse propre ou sale, évier vide ou encombré), si bien que la même instruction peut nécessiter des séquences d'actions radicalement différentes selon ce que l'agent perçoit. L'intérêt d'AsgardBench est de cibler précisément une compétence souvent noyée dans les évaluations existantes : l'adaptation du plan à partir de l'observation visuelle. La plupart des benchmarks actuels mêlent navigation, perception et contrôle physique dans une seule épreuve, ce qui rend impossible de savoir si un agent performe grâce à sa compréhension de l'environnement ou simplement parce que l'environnement est suffisamment prévisible pour être scripté. En isolant la révision de plan — sans demander à l'agent de naviguer dans une pièce ni de raisonner sur l'emplacement précis d'un meuble — le benchmark permet de mesurer directement si le modèle utilise ce qu'il voit pour décider de ce qu'il fait. C'est une distinction critique pour les applications réelles : un robot ménager qui ignore qu'une tâche est déjà accomplie va gaspiller des ressources, voire causer des erreurs en chaîne. Ce travail s'inscrit dans un contexte de forte effervescence autour de l'IA incarnée (embodied AI), un domaine où des acteurs comme Google DeepMind, Meta et plusieurs laboratoires universitaires investissent massivement pour créer des agents capables d'agir dans des environnements physiques ou simulés. AI2-THOR, développé par l'Allen Institute for AI, est déjà largement utilisé comme terrain d'entraînement pour ces systèmes. AsgardBench ne cherche pas à remplacer les benchmarks existants mais à combler un angle mort : la capacité de replanning visuel sous feedback minimal. Les suites probables incluent des évaluations sur des environnements plus ouverts, des instructions plus ambiguës, ou l'intégration de modèles multimodaux de nouvelle génération comme GPT-4o ou Gemini 2.0, dont la capacité à raisonner visuellement en boucle fermée reste encore peu documentée dans des conditions aussi contrôlées.

RecherchePaper
1 source
Créez avec Lyria 3, notre nouveau modèle de génération musicale
692Google AI Blog 

Créez avec Lyria 3, notre nouveau modèle de génération musicale

Google lance Lyria 3, son nouveau modèle de génération musicale, désormais accessible en préversion payante via l'API Gemini et en test gratuit dans Google AI Studio. Cette mise à disposition marque une étape importante pour les développeurs souhaitant intégrer de la création musicale dans leurs applications. Lyria 3 représente la version la plus avancée de la famille Lyria, offrant des capacités de synthèse audio de haute qualité directement accessibles via API. Lyria est la gamme de modèles IA musicaux de Google DeepMind, concurrente directe d'outils comme Suno ou Udio. Son intégration à l'écosystème Gemini facilite son adoption par les développeurs déjà familiers avec les outils Google.

OutilsActu
1 source
OpenAI veut doubler son nombre d’employés en 2026 : comment postuler ?
693Le Big Data 

OpenAI veut doubler son nombre d’employés en 2026 : comment postuler ?

OpenAI prévoit de doubler ses effectifs, passant de 4 500 à 8 000 employés d'ici fin 2026 (soit +80 %), selon Reuters. Face à la concurrence de Google et de ses modèles Gemini, l'entreprise a déclenché un "code red" fin 2025 pour accélérer ses développements. Au-delà des profils techniques, OpenAI recrute aussi des rôles hybrides comme les "technical ambassadors", chargés d'accompagner les entreprises dans l'adoption de ses outils.

BusinessActu
1 source
Rohit Patel (Meta) : « L’IA actuelle est une base largement suffisante pour transformer profondément la société »
694La Tribune 

Rohit Patel (Meta) : « L’IA actuelle est une base largement suffisante pour transformer profondément la société »

Rohit Patel, directeur du Superintelligence Labs de Meta, estime que les grands modèles de langage actuels (Llama, ChatGPT, Gemini) constituent une base suffisante pour transformer profondément la société, contrairement à Yann LeCun qui juge nécessaire d'aller au-delà de l'IA générative. Il reconnaît cependant des limitations importantes à ces modèles, notamment l'absence de mémoire robuste et l'incapacité à percevoir le passage du temps.

LLMsOpinion
1 source
Comment concevoir un agent IA prêt pour la production qui automatise les workflows Google Colab avec Colab-MCP, MCP Tools, FastMCP et l'exécution du kernel
695MarkTechPost 

Comment concevoir un agent IA prêt pour la production qui automatise les workflows Google Colab avec Colab-MCP, MCP Tools, FastMCP et l'exécution du kernel

Google a publié colab-mcp, un serveur MCP open-source permettant à des agents IA (comme Claude ou Gemini) de contrôler programmatiquement des notebooks Google Colab via le protocole JSON-RPC. Le tutoriel couvre deux modes opérationnels : le Session Proxy (pont WebSocket entre navigateur et agent) et le Runtime Mode (exécution directe de code dans le kernel Jupyter avec état persistant). Il détaille également la construction d'une boucle d'agent complète avec FastMCP, incluant gestion des erreurs, retries exponentiels, et séquençage de cellules dépendantes pour un usage en production.

OutilsOutil
1 source
696Frandroid 

Votre Mac va enfin accueillir l’une des meilleures IA

Google prépare le lancement d'une application native Gemini pour macOS, rejoignant ainsi les offres déjà proposées par Anthropic et OpenAI sur la plateforme d'Apple. Cette application offrira aux utilisateurs Mac un accès amélioré à l'IA Gemini. Aucune date de sortie précise n'est mentionnée.

OutilsOutil
1 source
697Wired AI 

Pourquoi Walmart et OpenAI remettent à plat leur accord de shopping agentique

Walmart intègre désormais son assistant IA Sparky directement dans ChatGPT et Google Gemini, après l'échec de la fonctionnalité Instant Checkout d'OpenAI. Ce changement de stratégie marque un tournant dans leur partenariat commercial axé sur le shopping agentique.

BusinessOpinion
1 source
La puissance de Personal Intelligence accessible au plus grand nombre
698Google AI Blog 

La puissance de Personal Intelligence accessible au plus grand nombre

Google étend sa fonctionnalité Personal Intelligence à davantage d'utilisateurs, en l'intégrant au mode IA de Search, à l'application Gemini et à Gemini dans Chrome. Cette expansion vise à offrir une expérience plus personnalisée à travers les différents produits Google alimentés par l'IA.

UELes utilisateurs européens de Google Search, Gemini et Chrome pourront bénéficier de fonctionnalités de personnalisation IA accrues, sous réserve des contraintes du RGPD.

OutilsOutil
1 source
Employés d'OpenAI et Google soutiennent le recours d'Anthropic contre le Pentagone
699The Verge AI 

Employés d'OpenAI et Google soutiennent le recours d'Anthropic contre le Pentagone

Anthropic a déposé lundi une plainte contre le Département de la Défense américain après avoir été désigné comme "risque pour la chaîne d'approvisionnement" — une classification habituellement réservée aux entreprises étrangères. Dans la foulée, près de 40 employés d'OpenAI et Google, dont Jeff Dean (chef scientifique de Google et responsable de Gemini), ont soumis un mémoire d'amicus curiae en soutien à Anthropic. Cette désignation par l'administration Trump soulève de vives inquiétudes sur ses implications pour le secteur de l'IA américain.

RégulationActu
1 source
Créez avec Nano Banana 2, notre meilleur modèle de génération et d'édition d'images
700Google AI Blog 

Créez avec Nano Banana 2, notre meilleur modèle de génération et d'édition d'images

Nano Banana 2 (Gemini 3.1 Flash Image) est le nouveau modèle de génération et d'édition d'images de Google, offrant une intelligence et une fidélité de niveau Pro pour toutes les applications d'image. Il apporte les capacités du modèle Pro dans un format optimisé pour les développeurs souhaitant intégrer la génération d'images dans leurs projets.

OutilsOutil
1 source