Aller au contenu principal

Dossier Gemini — page 13

702 articles · page 13 sur 15

Gemini, la famille de modèles de Google DeepMind : sorties Flash et Pro, intégration Apple/Siri, agents Robotics ER, capacités vocales temps réel.

GitLab passe à l’offensive : ce partenariat avec Google pourrait bousculer GitHub Copilot
601Le Big Data BusinessActu

GitLab passe à l’offensive : ce partenariat avec Google pourrait bousculer GitHub Copilot

GitLab a annoncé le 13 juillet 2026 une extension de son partenariat avec Google Cloud pour proposer une plateforme DevSecOps entièrement gérée, destinée aux entreprises qui développent des logiciels à grande échelle. Cette offre managée sera déployée via des prestataires certifiés comme Beyond et Digital Future, qui prennent en charge l'infrastructure sous-jacente pour le compte des clients. Sur le volet intelligence artificielle, GitLab intègre désormais les derniers modèles Gemini de Google, dont Gemini 3.5, au sein de GitLab Duo Agent, son assistant IA pour le développement. Les modèles ouverts Gemma 4 sont eux proposés aux utilisateurs de GitLab Duo Self-Hosted, la version auto-hébergée de la solution. Les organisations disposent ainsi d'un choix élargi de modèles, tout en gardant la possibilité de conserver leurs données dans leur propre environnement plutôt que de dépendre exclusivement du cloud public. Cette annonce répond à des préoccupations très concrètes pour les directions informatiques des grandes entreprises, en particulier celles qui opèrent dans des secteurs réglementés comme la finance ou la santé. L'adoption de l'IA dans le développement logiciel s'accompagne en effet de questions croissantes sur la résidence des données, la gouvernance et la conformité réglementaire. En proposant une plateforme unique qui combine développement, sécurité, conformité et intelligence artificielle, GitLab cherche à éviter aux entreprises de multiplier les outils et les fournisseurs. Pour une DSI, cela peut se traduire par une réduction du nombre d'audits à mener, un contrôle plus fin sur l'emplacement des données sensibles, et une simplification des déploiements, sans pour autant renoncer à l'accès aux modèles d'IA les plus récents. Cette stratégie vise directement GitHub Copilot, qui domine largement le marché grâce à son intégration native dans GitHub et à l'écosystème Microsoft. Là où Copilot reste avant tout un assistant de programmation centré sur l'écriture de code, GitLab mise sur une approche plus large en intégrant l'IA à l'ensemble du cycle DevSecOps, de la rédaction du code jusqu'aux contrôles de sécurité et d'audit. Cette différenciation pourrait séduire les entreprises soucieuses de limiter leur dépendance à un unique fournisseur cloud et de renforcer leur souveraineté numérique. Reste à savoir si cette offre suffira à faire bouger des parts de marché face à l'avance considérable accumulée par Microsoft et GitHub Copilot ces dernières années, et comment Google positionnera à terme ses propres outils de développement face à ce partenariat.

UELes entreprises européennes de secteurs réglementés (finance, santé) pourraient profiter d'options renforcées de résidence des données et de conformité, mais aucune entité française n'est directement concernée par cette annonce.

1 source
Skyfall AI lance MORPHEUS, un benchmark de simulation d'entreprise persistante qui rend l'apprentissage par renforcement continu nécessaire
602MarkTechPost 

Skyfall AI lance MORPHEUS, un benchmark de simulation d'entreprise persistante qui rend l'apprentissage par renforcement continu nécessaire

Skyfall AI vient de publier MORPHEUS, une plateforme de simulation d'entreprise persistante conçue pour l'apprentissage par renforcement continu (continual reinforcement learning, CRL). Le système s'appuie sur la Big World Hypothesis formulée par Javed et Sutton en 2024, selon laquelle la complexité du monde réel dépasse toujours la capacité de représentation d'un agent, rendant l'environnement non stationnaire même à dynamique fixe. Chaque environnement MORPHEUS est un module TypeScript autonome qui exporte des Operational Descriptors définissant le déroulé pas à pas d'une capacité, une planification de simulation, des données d'amorçage et une documentation. Deux moteurs génèrent la non-stationnarité: un moteur d'injection de pannes qui insère onze types de défaillances (données manquantes, échecs de dépendances, limitations de débit) à quatre niveaux d'intensité allant de 5% à 30%, et un contrôleur de changement de configuration asynchrone qui modifie les préréglages de pannes et la demande à des horaires fixes, indépendamment de la boucle d'entraînement. La récompense composite combine trois signaux, pondérés respectivement à 0,5 pour les événements de panne et 0,25 chacun pour le registre financier et le débit de ressources, avec un plafond théorique de 0,50 par configuration. L'initialisation des politiques repose sur un pipeline en deux étapes: le modèle Gemini 3.1 Pro collecte des trajectoires via le framework ReAct, qui servent ensuite à affiner Qwen3-14B par apprentissage supervisé, avant que tous les algorithmes ne poursuivent l'entraînement en ligne avec PPO à partir de ce même point de départ commun. Cette approche répond à un problème concret: la quasi-totalité des benchmarks d'apprentissage par renforcement réinitialisent le monde simulé après chaque épisode, alors que les opérations réelles en entreprise ne se réinitialisent jamais. Un agent chargé de la logistique, de la planification ou de l'allocation de ressources doit composer avec des décisions passées qui influencent durablement la suite, des pannes imprévisibles et des politiques optimales qui deviennent obsolètes avec le temps. En forçant la persistance, la non-stationnarité et l'absence de politique fixe optimale, MORPHEUS cherche à mesurer si un agent sait réellement s'adapter en continu plutôt que simplement mémoriser une stratégie figée. C'est une distinction cruciale pour les entreprises qui envisagent de déployer des agents autonomes dans des environnements opérationnels réels, où les conditions changent constamment et où l'échec d'adaptation coûte cher. Pour évaluer cette capacité d'adaptation, l'équipe de recherche a développé un protocole à six métriques allant au-delà de la simple récompense cumulée: récompense par configuration, vitesse d'adaptation, oubli, temps de récupération, stabilité et écart de performance, complété par deux diagnostics supplémentaires mesurant l'avantage d'adaptation relatif et la plasticité via le rang effectif. La vitesse d'adaptation, présentée comme la métrique phare, compte le nombre d'étapes nécessaires pour que la récompense moyenne glissante atteigne la moitié du plafond théorique. Les chercheurs ont testé quatre familles d'algorithmes à partir du même point de départ SFT sur deux tâches: l'allocation dynamique de ressources sous dérive structurée, et la planification sous dérive avec effets différés. Cette initiative s'inscrit dans un mouvement plus large de la recherche en IA vers des benchmarks plus réalistes, capables de capturer la complexité et l'imprévisibilité des environnements de production, plutôt que des tâches simplifiées et statiques qui surestiment les capacités réelles des agents autonomes.

💬 Skyfall AI a raison sur un point: presque tous les benchmarks RL réinitialisent le monde à chaque épisode, alors qu'en entreprise rien ne redémarre jamais. MORPHEUS teste si un agent s'adapte en continu ou s'il mémorise juste une politique figée qui s'effondre à la première dérive, et c'est exactement la question qu'on esquive depuis des années sur les agents autonomes en prod. Reste à voir si les métriques tiennent au-delà du papier, mais l'angle est le bon: un agent qui ne sait pas oublier proprement coûtera plus cher qu'il ne rapporte.

RecherchePaper
1 source
Proton Lumo 2.0 : l’assistant IA qui protège enfin vos données
603Le Big Data 

Proton Lumo 2.0 : l’assistant IA qui protège enfin vos données

Proton, l'entreprise suisse connue pour ses services de messagerie chiffrée, de VPN et de stockage cloud, a lancé Proton Lumo 2.0, une nouvelle version de son assistant d'intelligence artificielle axé sur la protection des données personnelles. Cette mise à jour introduit trois nouveautés majeures : un mode de raisonnement capable de décomposer les demandes complexes en plusieurs étapes logiques pour des réponses plus précises, une mémoire persistante que l'utilisateur peut activer, consulter ou supprimer à tout moment, et une fonction de recherche web permettant à l'assistant d'aller chercher des informations récentes pour enrichir ses réponses. L'ensemble repose sur un chiffrement renforcé et une infrastructure hébergée en Europe, avec une politique de collecte de données volontairement restreinte. Contrairement à la plupart des grands assistants IA, Lumo n'exploite pas les conversations des utilisateurs pour entraîner ses modèles ou cibler de la publicité. Cette approche change la donne pour les utilisateurs soucieux de confidentialité, qu'il s'agisse de particuliers, d'entreprises ou d'administrations, qui hésitent souvent à confier des documents sensibles à des assistants américains dont les politiques de données restent parfois opaques. En proposant un outil aussi capable au quotidien, résumer un document, répondre à des questions techniques, effectuer une recherche, mais sans les compromis habituels sur la vie privée, Proton cherche à démontrer qu'il n'est pas nécessaire de sacrifier la confidentialité pour bénéficier d'une IA performante. L'intégration avec les autres briques de l'écosystème Proton (messagerie, calendrier, stockage sécurisé) renforce cet argument en offrant un environnement cohérent où toutes les données restent protégées par les mêmes standards. Pour les organisations soumises à des exigences réglementaires strictes, notamment en Europe, ce positionnement peut devenir un critère de choix aussi important que la puissance brute du modèle. Ce lancement s'inscrit dans un contexte où les inquiétudes autour de la collecte massive de données par les grands acteurs de l'IA, OpenAI, Google ou Microsoft en tête, ne cessent de croître, alimentées par des scandales réguliers sur l'usage des conversations utilisateurs. Proton mise sur sa réputation acquise depuis des années dans la messagerie sécurisée pour s'imposer comme une alternative européenne crédible, à contre-courant d'une course à la puissance de calcul dominée par les entreprises américaines et chinoises. Reste à savoir si Lumo parviendra à rivaliser en termes de performances brutes avec des modèles comme GPT ou Gemini, dont les capacités de raisonnement et de recherche sont scrutées de très près. La bataille entre confidentialité et puissance risque de structurer les prochains mois du marché des assistants IA, à mesure que la régulation européenne, notamment l'AI Act, pousse les entreprises à revoir leurs pratiques de gestion des données.

UELumo renforce l'offre d'assistants IA hébergés en Europe, offrant aux entreprises et administrations soumises au RGPD et à l'AI Act une alternative crédible aux assistants américains.

💬 Lumo 2.0 ne joue pas la course à la puissance brute, et c'est justement ce choix qui est malin. Sur le papier, mémoire persistante que tu contrôles, recherche web, chiffrement renforcé, sans entraîner leurs modèles sur tes conversations, ça coche des cases que Google ou OpenAI refusent depuis des années. Pour une boîte ou une administration sous RGPD, la vraie question n'est plus "quel modèle est le plus fort" mais "à qui je fais confiance avec mes documents", et sur ce terrain-là, Proton a une longueur d'avance que les géants américains ne peuvent pas rattraper juste en changeant leurs conditions d'utilisation.

OutilsOutil
1 source
Le sens d'un titre : une startup propose une solution au problème de la pensée unique de l'IA
604MIT Technology Review 

Le sens d'un titre : une startup propose une solution au problème de la pensée unique de l'IA

La startup australienne Springboards a mis au point un modèle de langage baptisé Flint, conçu pour sortir les intelligences artificielles conversationnelles de leur tendance à toujours produire les mêmes réponses. Le constat de départ est simple à vérifier: demandez à Claude, ChatGPT ou Gemini de citer un nombre au hasard entre 1 et 10, et la réponse sera presque systématiquement 7. Ce phénomène, documenté par Will Douglas Heaven dans la newsletter The Download du MIT Technology Review, illustre un problème plus large de "pensée de groupe" chez les grands modèles de langage actuels, qui convergent vers des réponses prévisibles et peu créatives dès qu'on leur pose une question ouverte. Flint a été entraîné spécifiquement pour élargir l'éventail de ses réponses face à des questions du type "où partir en vacances en Europe", en évitant de se replier systématiquement sur les suggestions les plus consensuelles ou les plus statistiquement fréquentes dans ses données d'entraînement. Cette uniformité des réponses n'est pas gênante pour des tâches comme la programmation ou la recherche factuelle, où la précision et la cohérence priment. Elle devient en revanche un vrai handicap pour tout usage créatif: remue-méninges, planification de voyage, génération d'idées ou exploration d'options originales. Un assistant qui reproduit toujours les mêmes schémas de réponse limite de fait sa valeur pour les utilisateurs qui cherchent justement à sortir des sentiers battus. En misant sur la diversité des réponses plutôt que sur leur seule exactitude, Springboards vise un usage encore peu exploité commercialement: celui des chatbots comme outils d'idéation plutôt que de simple recherche d'information, un segment où la personnalisation et la surprise comptent autant que la fiabilité. Ce travail s'inscrit dans un paysage de l'IA générative en pleine effervescence, où les grands acteurs américains et chinois se disputent la suprématie technologique et financière. Le même jour, la newsletter rapportait qu'OpenAI aurait proposé de céder une participation de 5% à l'administration Trump, un geste qui pourrait s'étendre à d'autres géants comme Anthropic, Google ou Meta selon Bloomberg. Parallèlement, le modèle chinois GLM-5.2 gagne du terrain auprès de clients occidentaux grâce à des coûts réduits, tandis que Meta explore de nouvelles sources de revenus en louant sa puissance de calcul et ses modèles hébergés. Dans ce contexte de concentration autour de quelques mastodontes, l'approche de Springboards rappelle qu'il existe encore de la place pour des acteurs plus modestes cherchant à résoudre des limites techniques précises, comme ce manque criant de diversité dans les réponses des IA conversationnelles les plus utilisées au monde.

💬 Demande à trois chatbots différents un chiffre au hasard entre 1 et 10, tu auras 7 à chaque fois, ça dit tout : nos IA ne pensent pas, elles moyennent. Springboards s'attaque à un angle mort que les géants n'ont aucun intérêt à corriger, OpenAI et Google optimisent pour rassurer, pas pour surprendre. Bonne nouvelle pour l'idéation, mais faut voir si Flint tient face à un vrai brainstorm : la diversité des réponses va devenir un critère de choix aussi important que la fiabilité.

LLMsOpinion
1 source
Les LLM sont pris dans une routine de pensée uniforme : cette startup veut les en sortir
605MIT Technology Review 

Les LLM sont pris dans une routine de pensée uniforme : cette startup veut les en sortir

Voici l'article traduit et résumé : Le studio australien Springboards a développé un modèle de langage baptisé Flint, conçu pour rompre avec l'uniformité des réponses que produisent les grands chatbots comme ChatGPT, Claude ou Gemini face à des questions ouvertes. Pip Bingemann, cofondateur et PDG de Springboards, illustre le problème avec un test simple : demander à un modèle un nombre aléatoire entre 1 et 10 renvoie presque systématiquement 7, puis 3 ou 4, puis 8 ou 9 lors des tentatives suivantes. Lors d'une démonstration, ChatGPT et Claude ont tous deux répondu 7, tandis que Flint donnait un nombre décimal comme 3,7916. Même schéma avec un type de voiture : ChatGPT et Claude citent généralement Toyota ou Honda, quand Flint propose un Ford F-150. Sur un slogan publicitaire pour les chaussures New Balance, Claude et ChatGPT ont tous deux produit "Run your way", contre "Built to last, run to win" pour Flint. Selon Bingemann, "la plupart des modèles de langage luttent contre les hallucinations, nous les accueillons à bras ouverts". Ce phénomène de conformisme, ou "groupthink", commence à attirer l'attention de la recherche. En novembre, une équipe a publié une étude intitulée "Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)", récompensée du prix du meilleur article à la conférence NeurIPS. En interrogeant 25 modèles différents, dont ceux des principales entreprises américaines ainsi que des modèles open source chinois et autres, à 50 reprises chacun sur une métaphore du temps, les chercheurs ont obtenu 1 250 réponses dont la grande majorité se résumait à des variations de "le temps est une rivière" ou "le temps est un tisserand". Kieran Browne, cofondateur et directeur technique de Springboards, explique que cette répétition est partout dès qu'on y prête attention, alors que l'interface conversationnelle donne l'illusion d'un échange personnalisé. Il cite l'exemple d'un nom de groupe de musique : la plupart des modèles proposent des mots comme "glass", "neon", "velvet" ou "static". Un test avec ChatGPT a ainsi produit une liste de 56 suggestions dominées par "Glass Harbor", "Static Empire", "Neon Hearts" et "Velvet Echo", tandis que Gemini livrait 15 propositions dont "Static Horizon". Cette homogénéité s'expliquerait par le fait que la plupart des modèles actuels sont entraînés de façon similaire, sur des données similaires, pour accomplir des tâches similaires. Si cette convergence ne pose pas de problème pour du code ou de la recherche factuelle, elle devient un frein dès qu'il s'agit de brainstorming ou de planification créative, comme organiser un voyage. En misant sur la diversité plutôt que sur la suppression des hallucinations, Springboards cherche à ouvrir un nouveau créneau face aux géants du secteur, misant sur le constat que l'information "perdue" par les modèles dominants reste accessible, mais simplement biaisée par leurs choix d'entraînement.

💬 Ça confirme un truc que je sens depuis des mois sans savoir le nommer : les grands modèles ne sont pas juste biaisés, ils sont clonés les uns sur les autres. La preuve est presque comique : demande un nombre au hasard, une marque de voiture, un slogan, et ChatGPT comme Claude sortent quasi toujours la même réponse, ce qui montre que leur créativité affichée n'est qu'une moyenne statistique déguisée en réponse originale. Le pari de Flint est malin (transformer l'hallucination en feature plutôt qu'en bug), mais je doute que ça suffise face à des géants qui, eux, ont la distribution.

LLMsPaper
1 source
GeneBench-Pro : OpenAI crée un benchmark si difficile que même GPT 5.6 Sol galère
606Le Big Data 

GeneBench-Pro : OpenAI crée un benchmark si difficile que même GPT 5.6 Sol galère

OpenAI a dévoilé le 30 juin 2026 GeneBench-Pro, un nouveau benchmark destiné à mesurer une compétence bien plus exigeante que la simple restitution de connaissances : le jugement scientifique des modèles d'intelligence artificielle. L'outil rassemble 129 problèmes couvrant la génomique, la biologie quantitative et la médecine translationnelle. Pour chaque exercice, l'IA reçoit un jeu de données réel, le contexte d'une expérience et une question précise, et doit explorer les données, choisir la méthode d'analyse adaptée, puis formuler une conclusion pertinente, exactement comme le ferait un chercheur face à un problème inédit. Avant la publication, OpenAI a fait valider 82 des 129 problèmes par des experts indépendants (doctorants, chercheurs postdoctoraux, scientifiques de l'industrie et professeurs), afin de vérifier le réalisme des scénarios et la cohérence des réponses attendues. Selon Alexander Strudwick Young, la plupart de ces exercices auraient mis en difficulté un doctorant livré à lui-même, sans l'appui d'un superviseur expérimenté. Sur ce test, GPT-5.6 Sol domine largement ses prédécesseurs avec 28,7 % de réussite en niveau de raisonnement maximal, et 31,5 % en mode Pro, contre moins de 5 % pour GPT-5 lors des premiers essais sur la version originale de GeneBench. Cette progression illustre un enjeu concret pour la recherche biomédicale : les experts estiment qu'un problème type de GeneBench-Pro demanderait entre 20 et 40 heures de travail à un spécialiste humain, facturées environ 200 dollars de l'heure, soit plusieurs milliers de dollars par exercice résolu. Une IA capable d'atteindre un niveau de compétence comparable pourrait effectuer le même travail pour seulement quelques dollars de coût d'inférence. L'écart de performance entre modèles reste toutefois considérable : Opus 4.8 plafonne à 16 %, Gemini 3.5 Flash à 8,1 %, Gemini 3.1 Pro à 3,1 %, GLM 5.2 à 4,6 %, DeepSeek V4 Pro à 2,4 % et Grok 4.3 à seulement 1,5 %. Ces résultats montrent qu'au-delà du simple niveau de raisonnement affiché, la capacité à naviguer dans des données biologiques désordonnées et à faire des choix méthodologiques justes reste un obstacle majeur pour la plupart des modèles, y compris les plus récents. Ce benchmark s'inscrit dans une tendance plus large de l'industrie de l'IA, qui cherche désormais à évaluer les modèles non plus sur des connaissances factuelles mais sur leur capacité à mener une véritable démarche scientifique, jugement, exploration et arbitrage méthodologique inclus. Tous les problèmes ont été créés de manière synthétique par OpenAI, ce qui lui permet de garder un contrôle total sur les données et de comparer précisément les réponses des modèles aux résultats attendus, tout en tenant compte du fait que plusieurs méthodes d'analyse différentes peuvent aboutir à une conclusion scientifiquement valable. Pour garantir une évaluation indépendante, OpenAI publie en open source dix problèmes représentatifs sur Hugging Face, et confie un second ensemble de 50 questions à Artificial Analysis, qui mènera ses propres évaluations comparatives des différents modèles d'IA. À terme, cet effort vise à mesurer si les agents d'intelligence artificielle peuvent réellement accélérer la recherche en biologie computationnelle, un domaine où la rareté des experts qualifiés et le coût élevé de leur temps constituent un frein important à l'innovation.

UECe benchmark pourrait aider les laboratoires de recherche biomédicale européens à évaluer si l'IA peut accélérer leurs travaux, mais n'implique directement aucune entreprise ou institution française ou européenne.

RecherchePaper
1 source
La moitié des utilisateurs de Claude estiment que l'IA gère déjà la moitié de leur travail
607The Decoder 

La moitié des utilisateurs de Claude estiment que l'IA gère déjà la moitié de leur travail

Selon une enquête menée par Anthropic auprès de près de 9 700 utilisateurs de Claude, environ la moitié d'entre eux estiment que l'IA est déjà capable de prendre en charge 50 % ou plus de leurs tâches professionnelles. Dans un horizon de douze mois, 26 % des sondés prévoient que l'IA couvrira entre 60 et 90 % de leur travail quotidien. Cette étude, publiée en juin 2026, constitue l'une des rares tentatives d'Anthropic de quantifier l'intégration réelle de son assistant dans les flux de travail professionnels. Ces chiffres dessinent une fracture générationnelle et expérientielle nette. Les travailleurs en début de carrière sont les plus anxieux face à cette évolution, craignant que l'IA ne réduise les opportunités d'apprentissage et de montée en compétences traditionnellement associées aux postes juniors. A l'inverse, les utilisateurs les plus intensifs de Claude se montrent les plus optimistes quant à leurs propres perspectives professionnelles, suggérant que la maîtrise de l'outil transforme la perception de la menace en avantage concurrentiel. Ce sondage intervient dans un contexte de débat intense sur l'impact de l'IA générative sur l'emploi. Anthropic, qui positionne Claude comme un assistant de productivité avancé face à ChatGPT d'OpenAI et Gemini de Google, a tout intérêt à documenter l'adoption réelle de son produit. Les résultats alimentent également les discussions autour du concept d'"agent IA" capable d'exécuter des tâches complexes de manière autonome, une direction vers laquelle l'ensemble de l'industrie s'oriente activement.

💬 Anthropic interroge ses propres utilisateurs sur la valeur de son produit, bon, c'est pas exactement une source neutre. Mais la fracture entre juniors anxieux et utilisateurs intensifs optimistes dit quelque chose de vrai : ceux qui maîtrisent l'outil ne voient plus une menace, ils voient un levier. La question, c'est si les débutants auront encore la chance d'apprendre avant de devoir maîtriser quoi que ce soit.

SociétéOpinion
1 source
OpenAI met à jour GPT-5.5 Instant : voici qu’est-ce que ça change
608Le Big Data 

OpenAI met à jour GPT-5.5 Instant : voici qu’est-ce que ça change

OpenAI a déployé le 24 juin 2026 une nouvelle mise à jour de GPT-5.5 Instant, le modèle par défaut de ChatGPT. Il s'agit de la troisième évolution majeure depuis le lancement du modèle le 5 mai 2026, après des versions précédentes axées sur la réduction des erreurs et la clarté des réponses. Cette fois, l'entreprise vise explicitement à rendre les échanges "plus fun" et plus naturels. La mise à jour est d'abord accessible aux abonnés payants, avant un déploiement progressif vers les utilisateurs de la version gratuite. Concrètement, le modèle améliore sa capacité à identifier l'intention derrière une question, à maintenir la continuité d'une conversation sur plusieurs échanges, à gérer des requêtes contenant plusieurs contraintes simultanées, et à intégrer les corrections apportées par l'utilisateur sans simplement répéter la même réponse. Ces ajustements ciblent les usages les plus fréquents de ChatGPT, qui ne sont pas les démonstrations techniques mais les besoins du quotidien : planifier un voyage, comparer des produits, rédiger un message délicat ou clarifier ses idées. Pour des dizaines de millions d'utilisateurs qui interagissent avec ChatGPT plusieurs fois par semaine, une meilleure compréhension du contexte et des contraintes change directement la qualité de l'expérience. Le fait que le modèle réagisse mieux aux corrections est particulièrement significatif : cela réduit les allers-retours frustrants où l'IA ignore les précisions apportées et répète son raisonnement initial, un défaut régulièrement reproché aux assistants conversationnels. Derrière ces améliorations se profile une architecture nouvelle baptisée "Dreaming", qui permettrait au modèle de construire progressivement un profil de l'utilisateur au fil des conversations pour mieux adapter ses réponses. OpenAI s'engage depuis le début 2026 dans une cadence de mises à jour soutenue sur GPT-5.5 Instant, son modèle le plus utilisé, ce qui reflète une stratégie claire : maintenir ChatGPT comme standard de référence face à la concurrence directe de Google Gemini, Anthropic Claude et des assistants intégrés dans les systèmes d'exploitation comme Copilot de Microsoft. La bataille ne se joue plus uniquement sur les benchmarks de raisonnement, mais sur la fluidité perçue au quotidien, un terrain où la différence entre modèles devient de plus en plus difficile à mesurer objectivement pour l'utilisateur final.

LLMsOpinion
1 source
3 leviers méconnus pour s’imposer dans les agents IA grâce au GEO
609FrenchWeb 

3 leviers méconnus pour s’imposer dans les agents IA grâce au GEO

La montée en puissance des assistants IA comme ChatGPT, Gemini et Perplexity redessine profondément les règles de la visibilité en ligne. Face à ces nouveaux moteurs de réponse, le référencement classique ne suffit plus : les entreprises doivent désormais optimiser leur présence pour être citées directement par des systèmes qui synthétisent l'information et répondent sans renvoyer vers les sources. C'est dans ce contexte qu'Emmanuel de Vauxmoret, expert inscrit à la cour d'appel de Paris, identifie trois leviers encore méconnus du GEO, le Generative Engine Optimization, pour s'imposer dans les réponses générées par l'IA. Cette évolution change concrètement la donne pour les équipes marketing et SEO : là où Google renvoyait du trafic vers les sites, les agents IA absorbent l'information et la restituent directement à l'utilisateur. Être ignoré par ces systèmes, c'est devenir invisible pour une part croissante du public, notamment les professionnels qui s'appuient quotidiennement sur ces outils pour s'informer et prendre des décisions. Le GEO s'inscrit dans une transformation plus large des habitudes de recherche, accélérée par l'explosion de l'usage des LLM grand public depuis 2023. Les entreprises qui maîtrisent tôt ces nouvelles règles de citation, structurer l'information de façon factuelle, construire une autorité thématique cohérente, et produire du contenu facilement synthétisable, disposent d'un avantage concurrentiel réel avant que la discipline ne se standardise.

UELes équipes marketing et SEO des entreprises françaises et européennes doivent adapter leur stratégie de contenu pour maintenir leur visibilité face aux assistants IA qui absorbent le trafic informationnel sans renvoyer vers les sources.

💬 Le SEO était déjà en train de muter, mais là c'est une rupture franche : les agents IA ne redirigent pas, ils répondent, et si tu n'es pas cité dans leur réponse tu n'existes plus pour une part du public. Le GEO n'est pas du SEO rebrandé, c'est une logique différente, celle de l'autorité thématique et de la structuration factuelle plutôt que du jeu de mots-clés. Reste à voir combien d'équipes marketing vont vraiment changer leur façon de produire du contenu, plutôt que coller "optimisé GEO" sur leurs vieilles pratiques.

OutilsOutil
1 source
OpenAI lance la guerre des prix dans l'IA avec des quotas flexibles pour son agent de code Codex
610The Decoder 

OpenAI lance la guerre des prix dans l'IA avec des quotas flexibles pour son agent de code Codex

OpenAI modifie son système de limites d'utilisation pour Codex, son agent de codage IA. Les utilisateurs peuvent désormais accumuler leurs réinitialisations de débit et les déclencher manuellement, plutôt que de voir ces crédits expirer automatiquement selon un calendrier fixe. Concrètement, si un développeur atteint son plafond en plein milieu d'une session, il peut immédiatement consommer une réinitialisation mise de côté, sans attendre le prochain cycle. Les abonnés aux formules Go, Plus, Pro et Business reçoivent chacun une réinitialisation gratuite au démarrage. Les utilisateurs Plus et Pro bénéficient en outre d'un mécanisme de parrainage : en invitant des amis, ils peuvent débloquer des crédits supplémentaires. Pour les développeurs qui intègrent Codex dans leurs flux de travail, cette flexibilité change concrètement la donne. Auparavant, atteindre une limite de débit en cours de session signifiait une interruption forcée, coûteuse en temps et en concentration. La possibilité de gérer ses crédits de manière proactive réduit les frictions dans l'utilisation intensive de l'agent. C'est aussi un signal fort sur le terrain concurrentiel : en améliorant l'expérience utilisateur sans baisser les prix, OpenAI cherche à fidéliser sa base face à une concurrence de plus en plus agressive. Cette annonce s'inscrit dans une guerre des prix qui s'intensifie dans le secteur des agents de codage IA. Anthropic avec Claude Code, Google avec Gemini, et des acteurs spécialisés comme Cursor ou GitHub Copilot se livrent une bataille acharnée pour capter les développeurs. Codex, capable d'écrire, tester et déboguer du code de manière autonome, représente l'un des paris stratégiques majeurs d'OpenAI pour 2026. Le mécanisme de parrainage introduit rappelle les tactiques de croissance virale du grand public, une approche inhabituellement agressive pour un outil professionnel.

OutilsOutil
1 source
[VIDÉO] Arena.ai : accédez à des outils d’IA gratuits sans débourser un centime
611Le Big Data 

[VIDÉO] Arena.ai : accédez à des outils d’IA gratuits sans débourser un centime

Arena.ai est une plateforme en ligne qui propose un accès gratuit à certains des grands modèles de langage les plus avancés du moment, dont Grok, Gemini et GPT, sans abonnement ni engagement financier. Le principe original de la plateforme repose sur la comparaison collaborative : l'utilisateur soumet un même prompt à deux modèles en parallèle, compare les réponses et vote pour la meilleure. Ces votes alimentent un classement public, un leaderboard, qui reflète les préférences réelles de la communauté plutôt que des benchmarks techniques artificiels. Mais rien n'oblige à participer au vote : Arena.ai peut tout aussi bien s'utiliser comme simple portail d'accès gratuit à ces modèles, selon le besoin du moment. L'intérêt concret pour les professionnels et les curieux est évident : les abonnements individuels aux outils d'IA leaders coûtent plusieurs dizaines d'euros par mois, et multiplier les accès devient vite coûteux. Arena.ai permet de solliciter ponctuellement un modèle puissant pour une tâche précise, rédaction, code, analyse, sans payer d'abonnement dédié. Pour des usages irréguliers ou pour tester un modèle avant de s'y engager, c'est une ressource à connaître. La plateforme présente néanmoins des limites réelles : la disponibilité des modèles n'est pas garantie en permanence, l'interface reste volontairement minimaliste, et la stabilité peut varier. Pour un workflow professionnel quotidien, un outil dédié reste préférable. Arena.ai s'inscrit dans une tendance plus large de plateformes cherchant à démocratiser l'accès aux LLM tout en produisant des données d'évaluation à grande échelle. Son système de vote pair-à-pair est inspiré du projet LMSYS Chatbot Arena, né dans le monde académique, qui a popularisé ce type de classement fondé sur les préférences humaines réelles. Alors que les grandes maisons comme OpenAI, Google ou xAI se livrent une concurrence intense sur les performances de leurs modèles, des plateformes comme Arena.ai deviennent des observatoires indépendants de la perception utilisateur, et un point d'entrée gratuit dans cet écosystème en pleine consolidation.

OutilsOutil
1 source
Google I/O : l’overdose d’annonces IA profite à DuckDuckGo
612Next INpact 

Google I/O : l’overdose d’annonces IA profite à DuckDuckGo

Les 19 et 20 mai 2026, Google a transformé sa conférence I/O en un défilé ininterrompu d'annonces liées à l'intelligence artificielle : nouveautés Gemini, agents conversationnels, outil de vibe coding AI Studio, lunettes connectées, et une refonte majeure de son moteur de recherche présentée comme la plus importante depuis 25 ans. Cette barre de recherche repensée accepte désormais des requêtes longues, des images, vidéos et fichiers, et intègre des agents capables de surveiller le web en continu pour suivre un sujet précis, comme une annonce immobilière ou une collaboration entre un sportif et une marque. Ces fonctions seront réservées aux abonnés AI Pro et AI Ultra dès l'été. Dans ce contexte de saturation, la version « No AI » de DuckDuckGo a enregistré des chiffres records : aux États-Unis, les visites ont progressé de 22,7 % en moyenne lors du week-end du Memorial Day (23-25 mai), avec un pic à 27,7 % le 24 mai. Les installations de l'application mobile ont bondi de 18,1 % en une semaine, et celles de l'application iPhone et iPad ont affiché une hausse moyenne de 33 %, culminant à 69,9 % le 25 mai. Ces chiffres illustrent une fracture qui s'accentue dans le rapport des utilisateurs à l'intelligence artificielle. DuckDuckGo No AI désactive les réponses générées par IA et supprime les images synthétiques des résultats, offrant une expérience de recherche traditionnelle. La progression est restée nettement concentrée aux États-Unis, marché sur lequel les annonces Google I/O ont eu le plus de résonance immédiate. Gabriel Weinberg, fondateur et PDG de DuckDuckGo, a résumé la situation sans détour : « Google impose l'IA aux utilisateurs sans leur laisser la possibilité de s'y opposer, résultat, les résultats de recherche se dégradent au lieu de s'améliorer. » Ce positionnement, centré sur le contrôle laissé à l'utilisateur, transforme le rejet de l'IA en argument commercial explicite. DuckDuckGo n'est pas un acteur marginal : le moteur, fondé sur la protection de la vie privée, propose par ailleurs ses propres outils d'IA, mais joue délibérément sur la polarisation croissante entre adoptants enthousiastes et utilisateurs réfractaires. Ce clivage s'est accentué depuis que les grandes plateformes ont commencé à intégrer l'IA de manière non optionnelle dans leurs interfaces. La stratégie de DuckDuckGo parie sur un segment d'utilisateurs qui refusent cette intégration forcée, un marché que les grandes plateformes laissent volontairement de côté. La question est de savoir si cette tendance reste un phénomène de niche réactif aux événements médiatiques, ou si elle traduit un repositionnement durable d'une partie de l'audience web face à l'omniprésence de l'IA générative.

UELe phénomène reste concentré aux États-Unis sans impact direct mesuré en France/UE, bien que le cadre réglementaire européen (RGPD) place les consommateurs français dans un contexte propice à ce type de rejet de l'IA imposée.

SociétéOpinion
1 source
Utilisateurs d’iPhone, vous pouvez maintenant précommander l’application Google AI Studio
613Le Big Data 

Utilisateurs d’iPhone, vous pouvez maintenant précommander l’application Google AI Studio

Google a ouvert ce 21 mai 2026 les précommandes de l'application Google AI Studio sur l'App Store d'Apple, avec un lancement officiel programmé au 1er juillet prochain. L'application sera gratuite au téléchargement, même si certaines fonctionnalités avancées pourraient rester liées aux abonnements payants Gemini. Côté Android, la version Play Store était déjà disponible en préinscription depuis le 19 mai. Concrètement, l'application permet de créer, tester et prototyper des applications basées sur l'IA Gemini directement depuis un smartphone, en utilisant des commandes vocales ou du texte, sans écrire une seule ligne de code. Google met en avant plusieurs fonctionnalités orientées productivité mobile : synchronisation entre appareils, partage de projets simplifié, et une galerie communautaire regroupant des exemples créés par d'autres utilisateurs. Cette version mobile de Google AI Studio représente un changement de cible significatif pour l'outil, jusqu'ici réservé aux développeurs sur navigateur. En rendant le prototypage d'applications IA accessible depuis un iPhone ou un Android, Google élargit son audience bien au-delà des ingénieurs : designers, chefs de produit, entrepreneurs ou simples curieux peuvent désormais tester des idées en déplacement, sans environnement de développement. L'enjeu est de démocratiser la création d'outils IA, en réduisant la friction technique à son minimum. Pour l'industrie, cela accélère potentiellement les cycles d'idéation et de validation de produits, à condition que l'expérience mobile tienne ses promesses en termes de performance et de complétude par rapport à la version desktop. Cette annonce s'inscrit dans une stratégie d'expansion agressive de l'écosystème Gemini par Google, qui cherche à couvrir l'ensemble des points de contact numériques, navigateur, IDE, assistant, et maintenant smartphone. La firme de Mountain View fait face à une concurrence directe d'OpenAI, qui pousse ChatGPT sur mobile avec des fonctionnalités de plus en plus avancées, et d'Anthropic, qui développe ses propres interfaces pour Claude. Proposer un outil de prototypage IA natif sur iOS et Android est aussi une réponse à l'appétit croissant des professionnels pour des workflows IA nomades. Si le lancement du 1er juillet confirme les fonctionnalités annoncées, Google AI Studio mobile pourrait s'imposer rapidement comme un outil de référence pour quiconque souhaite expérimenter avec les modèles Gemini sans contrainte de lieu ni de configuration technique.

UELes professionnels et indépendants européens pourront prototyper des applications IA directement depuis leur smartphone dès le 1er juillet 2026, sans configuration technique ni environnement de développement.

OutilsOutil
1 source
Comment créer des pipelines de génération de graphes de connaissances à partir de texte avec kg-gen, NetworkX et des visualisations interactives
614MarkTechPost 

Comment créer des pipelines de génération de graphes de connaissances à partir de texte avec kg-gen, NetworkX et des visualisations interactives

Une équipe de chercheurs de l'Université Stanford a publié un tutoriel complet présentant kg-gen, une bibliothèque Python open source permettant de générer automatiquement des graphes de connaissances à partir de texte non structuré. Le workflow décrit s'appuie sur trois outils principaux : kg-gen pour l'extraction des entités et relations, NetworkX pour l'analyse des structures de graphes, et PyVis ainsi que Matplotlib pour la visualisation interactive. Le processus repose sur un modèle de langage configuré via LiteLLM, une couche d'abstraction qui permet de brancher indifféremment GPT-4o-mini d'OpenAI, Claude d'Anthropic, Gemini de Google ou des modèles locaux via Ollama. À partir d'un texte simple, « Linda est la mère de Josh, Ben est son frère, Andrew son père, Josh étudie à Stanford », kg-gen identifie automatiquement les entités (Linda, Josh, Ben, Stanford) et les relations sémantiques qui les lient sous forme de triplets sujet-prédicat-objet. Pour les passages plus longs, la bibliothèque intègre un mécanisme de découpage par chunks de 800 caractères et un algorithme de clustering qui regroupe les entités synonymes, évitant ainsi les doublons lorsqu'un même concept apparaît sous plusieurs formes dans le texte source. L'intérêt concret de cet outil réside dans sa capacité à transformer des corpus textuels volumineux et désordonnés en structures de données navigables et interrogeables. Pour les équipes data, les chercheurs ou les développeurs travaillant sur des bases documentaires, cela représente un gain significatif : là où il fallait annoter manuellement les relations entre concepts, kg-gen automatise l'extraction en quelques lignes de code. Le graphe résultant peut ensuite être analysé avec NetworkX pour identifier les nœuds les plus connectés, détecter des communautés thématiques, ou mesurer la centralité de certains acteurs dans un corpus. La visualisation interactive via PyVis permet de naviguer dans le graphe directement dans un notebook Jupyter ou un navigateur, ce qui ouvre des usages en veille technologique, en analyse de réseaux d'influence ou en construction de bases de connaissances pour des systèmes RAG. kg-gen a été développé à Stanford et s'appuie en interne sur DSPy, un framework de programmation déclarative pour les LLM, pour garantir des sorties structurées et reproductibles. LiteLLM, qui sert de couche de routage, supporte une quarantaine de fournisseurs de modèles, ce qui rend le pipeline indépendant d'un prestataire unique. Ce tutoriel s'inscrit dans une tendance plus large visant à combiner les grands modèles de langage avec des représentations symboliques du savoir, à mi-chemin entre les approches purement neuronales et les systèmes expert classiques. Plusieurs grandes entreprises tech explorent cette direction pour améliorer la fiabilité des réponses de leurs IA, notamment en réduisant les hallucinations en ancrant le raisonnement dans un graphe de faits vérifiables. La prochaine étape naturelle du projet consiste à fusionner des graphes issus de sources multiples, un problème d'alignement d'entités que kg-gen aborde également dans les sections avancées du tutoriel.

OutilsTuto
1 source
Les clés pour décrocher un poste dans un laboratoire d'IA de pointe (en préentraînement)
615Latent Space 

Les clés pour décrocher un poste dans un laboratoire d'IA de pointe (en préentraînement)

Vlad Feinberg, ingénieur spécialisé dans l'infrastructure TPU chez Google, a publié mi-mai 2026 un guide destiné aux développeurs souhaitant intégrer les grands laboratoires d'IA de pointe. Son conseil central : maîtriser le travail au niveau du noyau (kernel) des modèles de langage. Il s'appuie sur le Scaling Handbook publié l'an dernier par DeepMind, un document qui cartographie les pratiques de préentraînement à grande échelle. Selon Feinberg, le principal goulot d'étranglement de tout projet LLM réside dans la capacité à rendre concrètement exécutables des modifications logiques abstraites, c'est-à-dire à optimiser les calculs au plus bas niveau du code. Il souligne aussi l'importance croissante des langages dédiés (DSL) pour le développement de kernels, et mentionne de façon inattendue les agents autonomes comme AlphaEvolve parmi les compétences désormais valorisées. Son exercice pratique est sans ambiguïté : dériver les lois de Chinchilla, les implémenter depuis zéro en JAX pour des architectures dense et MoE, puis écrire un kernel Pallas capable de surpasser jax.lax.ragged_dot pour les projections MoE en fusionnant les couches up et down, et identifier un contexte où l'accélération du forward pass est mesurable et explicable. Ce type de guide est rare dans un domaine qui recrute souvent via des réseaux opaques. En pointant vers des compétences précises et vérifiables plutôt que vers des diplômes ou des expériences académiques, Feinberg ouvre potentiellement l'accès aux laboratoires de pointe à des profils autodidactes ou venant d'industries connexes. Le travail au niveau kernel, qui consiste à optimiser les calculs matriciels sur GPU ou TPU pour réduire la latence et améliorer l'utilisation de la mémoire, est au coeur de la compétitivité des modèles. C'est aussi une compétence objectivement mesurable : soit le kernel bat le benchmark de référence, soit il ne le bat pas. Feinberg propose même d'inviter ceux qui réussissent l'exercice complet à intervenir comme speakers lors d'ateliers communautaires, signal clair que la démonstration pratique vaut plus qu'un CV. Cette publication intervient dans un contexte d'accélération générale de l'écosystème IA. Anthropic a diffusé la même semaine des bonnes pratiques pour déployer Claude Code sur des monorepos de plusieurs millions de lignes, avec diagnostics de cache de prompts et activation par défaut du mode Fast sur Opus 4.7 pour des workflows à plus faible latence. Cognition a lancé Devin Auto-Triage, un agent "premier répondant" pour les bugs et incidents en production, doté d'une mémoire long terme et capable de générer des pull requests automatiquement. LangChain a présenté LangSmith Engine comme une boucle CI/CD pour agents, détectant automatiquement les défaillances en production. À la veille de Google I/O, moment attendu pour les annonces Gemini, le secteur converge vers des agents persistants en arrière-plan plutôt que vers de simples interfaces conversationnelles, et les ingénieurs capables d'en construire les fondations bas-niveau restent la ressource la plus recherchée.

LLMsTuto
1 source
Gregory Nicolaidis, avec l’IA générative, « produire plus ne sert plus à rien. Il faut produire plus cohérent. »
616FrenchWeb 

Gregory Nicolaidis, avec l’IA générative, « produire plus ne sert plus à rien. Il faut produire plus cohérent. »

Gregory Nicolaidis, fondateur et stratège en content marketing, tire la sonnette d'alarme sur une mutation profonde du secteur : l'avènement de l'IA générative met fin à la logique du volume qui a dominé le web pendant deux décennies. Dans une interview accordée à FW.MEDIA, il formule un constat tranché, "produire plus ne sert plus à rien, il faut produire plus cohérent", résumant le virage stratégique que les équipes marketing doivent opérer dès maintenant pour rester visibles dans un écosystème de recherche en pleine recomposition. L'enjeu est concret : les entreprises ne luttent plus seulement pour des positions sur Google, mais pour apparaître dans les réponses synthétisées de ChatGPT, Claude, Gemini ou Perplexity. Ces assistants ne listent pas dix liens, ils proposent une réponse unique. Si une marque ou un expert n'est pas cité dans ces synthèses, il disparaît du radar d'une part croissante des utilisateurs qui ne cliquent plus jamais sur un résultat traditionnel. La qualité, la cohérence éditoriale et l'autorité thématique deviennent les nouveaux critères de référencement. Cette transformation s'inscrit dans une évolution plus large du comportement des internautes, qui délèguent de plus en plus leur recherche d'information à des agents conversationnels. Pour les équipes marketing, cela implique de repenser entièrement leur architecture de contenu : privilégier la profondeur thématique sur la fréquence de publication, construire une identité éditoriale reconnaissable et structurer l'information de façon à ce qu'elle soit facilement ingérable par les modèles de langage. Le SEO classique ne disparaît pas, mais il cède du terrain à ce que certains appellent déjà le GEO, ou Generative Engine Optimization.

UELes équipes marketing françaises doivent repenser leur stratégie de contenu pour rester visibles dans les réponses des moteurs génératifs, au détriment des approches SEO traditionnelles.

SociétéOpinion
1 source
Le méta-système de Poetiq construit un cadre universel améliorant tous les LLM sur LiveCodeBench Pro sans affinage
617MarkTechPost 

Le méta-système de Poetiq construit un cadre universel améliorant tous les LLM sur LiveCodeBench Pro sans affinage

La startup Poetiq a publié des résultats qui retiennent l'attention dans le domaine de l'IA : son système baptisé Meta-System a atteint un nouveau niveau de performance sur LiveCodeBench Pro, un benchmark compétitif de codage, en construisant et optimisant automatiquement son propre environnement d'inférence. Sans entraîner les modèles sous-jacents ni accéder à leurs paramètres internes, le Meta-System a permis à GPT 5.5 High de passer de 89,6 % à 93,9 % sur ce benchmark. Plus spectaculaire encore : Gemini 3.1 Pro, le modèle sur lequel le système a été optimisé, bondit de 78,6 % à 90,9 %, surpassant ainsi Gemini 3 Deep Think de Google lui-même, crédité de 88,8 % mais non accessible via API pour vérification externe. Il s'agit du troisième benchmark public de Poetiq, et le choix de LiveCodeBench Pro était délibéré. Ce que Poetiq appelle un « harness » est la couche d'orchestration enveloppant un modèle de langage : elle contrôle comment le modèle est sollicité, comment les sorties sont structurées, comment les réponses sont assemblées sur plusieurs appels, et comment les solutions sont évaluées. Traditionnellement, ces architectures sont construites à la main par des ingénieurs. La proposition de Poetiq est que le Meta-System les construit et les optimise de manière entièrement automatique, par amélioration récursive. En pratique, le système développe de meilleures stratégies de questionnement, affine des chaînes de raisonnement séquentielles, et assemble les réponses de façon adaptive, en intégrant les apprentissages de tâches précédentes. L'impact est immédiat pour l'industrie : si un tel système peut améliorer n'importe quel modèle sans accès privilégié ni réentraînement coûteux, cela repositionne la compétition non plus uniquement sur la qualité intrinsèque des modèles, mais sur la sophistication de l'infrastructure qui les entoure. LiveCodeBench Pro a été conçu pour résister à deux défauts récurrents des benchmarks : la contamination des données et le surapprentissage. Il puise ses problèmes dans les compétitions de programmation compétitive, valide les solutions via un cadre de tests complet, et impose des contraintes strictes de mémoire et de temps d'exécution, notamment en C++. Le benchmark est aussi mis à jour en continu, ce qui le distingue des évaluations statiques qui finissent par devenir obsolètes. Pour Poetiq, le codage représente la catégorie commerciale la plus répandue de l'IA aujourd'hui, mêlant raisonnement, récupération d'information et génération de logique procédurale complexe. L'entreprise entend démontrer que l'amélioration récursive automatique des harnesses constitue une voie complémentaire au scaling traditionnel des modèles, avec des gains substantiels à la clé pour tous les acteurs souhaitant tirer davantage de valeur des LLM existants.

LLMsOutil
1 source
Conseil sur le feedback des agents
618Ben's Bites 

Conseil sur le feedback des agents

Un développeur partage une technique récente pour fluidifier ses échanges avec des agents IA : plutôt que de taper ses retours ou d'utiliser la dictée vocale, il enregistre son écran en commentant à voix haute ce qu'il fait, puis fournit cette vidéo directement à l'agent. Ce dernier analyse les images, transcrit la voix, extrait les moments clés horodatés et génère un rapport HTML structuré, avec des GIFs illustrant les points importants et une liste d'actions à accomplir. La méthode permet aussi de naviguer vers d'autres applications pour montrer des exemples de référence, que l'agent intègre dans son analyse. Ben a formalisé cette approche en une "skill" réutilisable baptisée video-to-html, qui instruit l'agent pour convertir n'importe quelle vidéo en document HTML structuré avec keyframes, horodatages et animations courtes. Les fichiers générés servent également de journal de bord du projet, consultables à tout moment. Cette technique s'attaque à un problème concret dans les workflows avec des agents : la difficulté à communiquer un retour visuel précis et contextualisé. Là où les feedbacks textuels restent abstraits et les captures d'écran statiques, la vidéo permet de montrer l'interface en situation réelle, de naviguer entre applications, et de commenter en temps réel ce qui fonctionne ou non. L'approche consomme davantage de tokens, mais l'auteur note que les agents analysent efficacement les frames extraites, rendant une compression préalable via ffmpeg superflue pour la plupart des usages. Pour les équipes travaillant régulièrement avec des agents de développement ou de design, ce type de boucle de feedback visuel structuré pourrait accélérer les itérations de manière significative, en réduisant les allers-retours d'éclaircissement. Cette semaine apporte également plusieurs annonces importantes pour l'écosystème IA. Anthropic a annoncé un changement de politique à compter du 15 juin : les utilisateurs de Claude via des outils tiers comme Cursor, Zed ou T3 Code disposeront d'un quota distinct, équivalent en valeur à leur abonnement mensuel, sans report possible ni tokens subventionnés au-delà. En compensation, les limites hebdomadaires augmentent de 50 % pendant les deux prochains mois. Vercel, de son côté, a publié un index de production basé sur l'usage réel de son AI Gateway : Anthropic capte 61 % des dépenses (porté par Opus), Google représente 38 % des volumes de tokens (grâce à Flash), et les workloads agentiques constituent désormais 59 % de la totalité des tokens consommés. Notion a lancé une plateforme développeur avec une API markdown permettant la synchronisation de données externes et l'intégration d'agents comme Claude directement dans l'outil, accompagnée d'un CLI nommé ntn. Google a présenté "Gemini Intelligence" pour Android, incluant l'autocomplétion de formulaires et la transformation de notes vocales en texte structuré, à quelques jours de sa conférence I/O.

OutilsOutil
1 source
La refonte de l'expérience shopping d'Amazon par l'IA
619The Information AI 

La refonte de l'expérience shopping d'Amazon par l'IA

Amazon a annoncé mercredi le renommage de son assistant d'achat propulsé par l'intelligence artificielle, jusqu'ici connu sous le nom de Rufus, au profit de la marque Alexa, bien plus établie dans l'esprit des consommateurs. Ce changement de nom s'inscrit dans une refonte plus large du service de shopping d'Amazon, qui intègre désormais un ensemble de nouvelles fonctionnalités basées sur l'IA. Rufus avait été lancé comme chatbot spécialisé pour guider les acheteurs dans leurs recherches de produits sur la plateforme, mais la marque n'a jamais réussi à s'imposer durablement dans la mémoire des utilisateurs. La décision de capitaliser sur le nom Alexa est stratégiquement limpide : des millions d'utilisateurs connaissent déjà cet assistant vocal, présent dans les foyers depuis des années via les enceintes Echo. En consolidant les deux expériences sous une même identité de marque, Amazon cherche à renforcer la cohérence de son écosystème et à offrir une expérience d'achat assistée par IA perçue comme familière et de confiance. L'enjeu est directement commercial : Amazon doit faire face à la montée en puissance des chatbots généralistes comme ChatGPT ou Gemini, qui commencent à capter une partie des requêtes de recherche de produits que les consommateurs adressaient auparavant directement à Amazon. Ce repositionnement rappelle la trajectoire de Google, qui avait lancé son chatbot sous le nom de Bard avant de le rebaptiser Gemini pour l'aligner sur une marque plus forte et plus cohérente. La bataille pour capter l'intention d'achat en amont du moteur de recherche traditionnel est devenue l'un des fronts les plus disputés du secteur tech. Pour Amazon, dont le chiffre d'affaires repose massivement sur sa marketplace, il est vital de rester le point d'entrée naturel pour les décisions d'achat en ligne. L'intégration accrue de l'IA dans l'expérience shopping, sous le pavillon Alexa, est sa réponse directe à cette menace structurelle.

UEAmazon étant présent sur le marché français et européen via Amazon.fr, ce repositionnement de l'assistant shopping sous la marque Alexa pourrait à terme affecter l'expérience d'achat des consommateurs européens, mais l'impact reste indirect et sans échéance précise annoncée pour l'Europe.

BusinessOpinion
1 source
Un nouveau site évalue les modèles d'IA de pointe sur l'échelle de QI humain : les résultats font déjà débat
620VentureBeat AI 

Un nouveau site évalue les modèles d'IA de pointe sur l'échelle de QI humain : les résultats font déjà débat

Un site baptisé AI IQ (aiiq.org) propose depuis la semaine dernière de noter les modèles d'intelligence artificielle selon le même barème que le quotient intellectuel humain. Créé par Ryan Shea, ingénieur et investisseur providentiel cofondateur de la plateforme blockchain Stacks ainsi que de Voterbase, le projet attribue un score IQ estimé à plus de 50 des grands modèles de langage actuels, puis les place sur une courbe en cloche standard. La méthodologie repose sur 12 benchmarks répartis en quatre dimensions : raisonnement abstrait (ARC-AGI-1 et ARC-AGI-2), mathématique (FrontierMath, AIME, ProofBench), programmatique (Terminal-Bench 2.0, SWE-Bench Verified, SciCode) et académique (Humanity's Last Exam, CritPt, GPQA Diamond). L'IQ final est la moyenne arithmétique des quatre scores dimensionnels. Au classement de mi-mai 2026, GPT-5.5 d'OpenAI trône en tête avec un IQ estimé à 136, talonné par Opus 4.7 d'Anthropic (environ 132), GPT-5.4 (131), Gemini 3.1 Pro de Google (131) et Opus 4.6 (129), un peloton de tête anormalement serré. L'initiative a immédiatement divisé. Du côté des partisans, des stratèges et technologues d'entreprise comme Brian Vellmure ou le commentateur Thibaut Mélen saluent sur X un outil qui rend lisible un marché impossible à comparer : là où les tableaux de benchmarks classiques noient l'utilisateur dans des colonnes de chiffres disparates, une seule valeur résume l'essentiel. Pour les décideurs qui doivent choisir un modèle sans être chercheurs en IA, c'est une boussole bienvenue. Mais les critiques ont été tout aussi rapides. Le compte AI Deeply, relayant l'inquiétude de nombreux chercheurs, résume le problème en une formule : « C'est du non-sens. L'IA est bien trop irrégulière. La carte n'est pas le territoire. » Le reproche central est que les capacités d'un modèle sont profondément asymétriques, excellent en code, médiocre en raisonnement spatial, brillant en langues latines, défaillant en logique formelle, et qu'un seul chiffre efface précisément cette information. Le projet s'inscrit dans une quête plus large de lisibilité du marché des LLMs, qui s'est fragmenté à une vitesse vertigineuse depuis 2024. Les benchmarks traditionnels prolifèrent, souvent incomparables entre eux, parfois contaminés par des données d'entraînement, et régulièrement accusés de ne mesurer que ce que les modèles ont déjà appris à optimiser. AI IQ tente d'y répondre en compressant les plafonds des benchmarks jugés trop faciles ou trop susceptibles de saturation, et en pénalisant les modèles dont les données sont incomplètes plutôt qu'en leur bénéficiant du doute. La convergence spectaculaire au sommet, où quatre modèles de trois laboratoires différents se retrouvent dans un écart de cinq points, illustre la compétition féroce entre OpenAI, Anthropic et Google, et pose la vraie question : si les scores sont presque identiques, sur quoi les entreprises vont-elles désormais choisir leur modèle ?

LLMsPaper
1 source
Google n'a pas modifié les fonctions IA locales de Chrome, elles restent aussi confuses qu'avant
621Ars Technica AI 

Google n'a pas modifié les fonctions IA locales de Chrome, elles restent aussi confuses qu'avant

Une confusion a récemment agité les utilisateurs de Chrome sur ordinateur : certains ont constaté que leur navigateur téléchargeait discrètement un modèle d'intelligence artificielle de 4 Go, le Gemini Nano de Google. Sur les réseaux sociaux, la découverte a été interprétée comme un déploiement massif et soudain d'IA sur toutes les installations Chrome. En réalité, ce comportement n'a rien de nouveau. Google avait annoncé dès 2024 l'intégration de capacités d'IA locale dans Chrome, destinées à alimenter des fonctionnalités comme "Help Me Write" (aide à la rédaction), l'organisation automatique des onglets et la détection des tentatives d'arnaque. Le modèle est téléchargé en arrière-plan depuis plusieurs années déjà, ce n'est pas une nouveauté technique, mais une nouveauté dans la perception des utilisateurs. Ce que cet épisode révèle avant tout, c'est l'incapacité chronique de Google à communiquer clairement sur ses déploiements d'IA. L'entreprise intègre des modèles lourds dans ses produits sans informer explicitement les utilisateurs, ce qui génère régulièrement des incompréhensions et une méfiance justifiée. Pour les 4 milliards d'utilisateurs de Chrome dans le monde, la question de ce qui tourne en local sur leur machine, et pourquoi, est pourtant loin d'être anodine, notamment sur des appareils aux ressources limitées. Ce flou s'inscrit dans une tendance plus large chez Google, qui multiplie les annonces d'IA sans toujours en expliquer les implications concrètes. Chrome embarque désormais bien d'autres fonctionnalités alimentées par Gemini : un chatbot en mode écran partagé, ainsi qu'une capacité à automatiser la navigation web. Le traitement local via Gemini Nano vise à préserver la confidentialité des données en évitant les allers-retours vers les serveurs cloud, un argument de poids face aux critiques sur la vie privée. Reste que sans transparence sur ce qui est installé, quand et pourquoi, la confiance des utilisateurs risque de s'éroder plus vite que les bénéfices de ces fonctionnalités ne s'imposent.

UELes centaines de millions d'utilisateurs européens de Chrome sont concernés par ce manque de transparence de Google sur le déploiement silencieux de Gemini Nano, une pratique potentiellement en tension avec les obligations d'information du RGPD.

ÉthiqueOutil
1 source
La Corée du Sud vient de créer un moine robot : même Black Mirror n’avait pas osé
622Le Big Data 

La Corée du Sud vient de créer un moine robot : même Black Mirror n’avait pas osé

Le 6 mai 2026, à la veille de l'anniversaire de Bouddha, le temple Jogye de Séoul, principal centre de l'ordre bouddhiste éponyme, l'un des plus influents de Corée du Sud, a organisé une cérémonie d'ordination pour un robot humanoïde. L'appareil, baptisé Gabi lors du rituel, mesure 1,30 mètre et repose sur la plateforme Unitree G1. Vêtu d'une robe monastique grise et brune, il s'est présenté devant des moines et des fidèles, les mains jointes, s'inclinant tandis qu'un moine lui remettait un chapelet de 108 perles. Un autocollant a remplacé la marque physique habituellement laissée par la brûlure d'encens. Cinq préceptes ont été spécialement réécrits pour lui : respecter la vie, ne pas endommager d'autres robots ou objets, obéir aux humains, éviter les comportements trompeurs et économiser son énergie. Gabi participera prochainement au festival des lanternes bouddhistes aux côtés de trois autres robots, Seokja, Mohee et Nisa. Au-delà du spectacle, l'initiative porte une intention explicitement philosophique. Le vénérable Seong Won, responsable culturel de l'ordre Jogye, a présenté l'ordination non comme un coup de communication mais comme une invitation à réfléchir à la coexistence entre humains et machines dans une société où l'intelligence artificielle occupe une place croissante. Pour les concepteurs du projet, intégrer un robot dans un espace aussi intimement humain que la spiritualité est précisément ce qui force la question : jusqu'où l'IA peut-elle s'immiscer dans des domaines que l'on croyait réservés à la conscience et à l'expérience subjective ? Le fait que les moines aient consulté ChatGPT et Gemini pour rédiger les règles morales de Gabi, une IA aidant à définir les principes éthiques d'un autre robot, illustre à quel point les frontières sont déjà brouillées. Cette ordination s'inscrit dans un contexte national particulier : la Corée du Sud est l'un des pays les plus avancés au monde en robotique et en adoption de l'IA, avec des robots déployés dans les cafés, les hôtels et les hôpitaux. L'ordre Jogye, qui administre plus de 1 700 temples à travers le pays, dispose d'une forte influence culturelle et d'une capacité réelle à faire résonner ce type d'initiative dans l'opinion publique. En choisissant d'ordonner un robot plutôt que de simplement l'exposer, les moines franchissent un pas symbolique fort : ils reconnaissent implicitement que la question de la place des machines dans la société humaine concerne désormais tous les espaces, y compris les plus sacrés. La prochaine étape, la participation de Gabi au festival des lanternes, sera un test grandeur nature de la réaction du public face à cette hybridation inédite entre tradition millénaire et technologie de pointe.

SociétéOpinion
1 source
15 prompts ChatGPT (et Grok) que vous devez absolument connaître sur Android
623Le Big Data 

15 prompts ChatGPT (et Grok) que vous devez absolument connaître sur Android

La France figure dans le top 5 mondial des pays consommateurs d'intelligence artificielle conversationnelle, avec 44 % des actifs qui utilisent régulièrement des outils comme ChatGPT, Grok ou Gemini. Pourtant, malgré plus de trois ans d'existence de ces assistants, la majorité des utilisateurs s'en servent uniquement pour de la rédaction basique. Un article publié en avril 2026 recense 15 usages concrets de ces outils sur Android, illustrant à quel point un smartphone peut devenir une station de travail à part entière grâce à des instructions bien formulées. Parmi les cas présentés : résumer une newsletter dense en points clés lisibles en une minute, transformer des notes brutes en e-mail professionnel, apprendre un concept complexe via une explication adaptée à l'écran mobile, ou encore identifier une recette à partir des ingrédients disponibles en photographiant son réfrigérateur. L'intérêt de ces usages dépasse le simple gain de temps. En formulant des contraintes précises dans les prompts, "fais tenir la réponse sur un seul écran", "donne la transcription phonétique", "adapte le format pour lecture rapide sur smartphone", l'utilisateur obtient des réponses calibrées pour la mobilité, là où des outils classiques comme Google Traduction butent sur le contexte ou les nuances culturelles. Ce type d'usage transforme l'IA générative en couche d'intelligence transversale superposée aux applications existantes : agenda, messagerie, cuisine, apprentissage, préparation d'entretiens professionnels ou situations sociales délicates. Pour les professionnels en déplacement constant, l'impact est immédiat et mesurable. Ce recensement de prompts s'inscrit dans une tendance plus large : après une phase d'adoption centrée sur le texte et la bureautique, les utilisateurs avancés cherchent désormais à exploiter les capacités multimodales des IA, vision, audio, raisonnement contextuel, directement depuis leur mobile. Les grands acteurs du secteur, OpenAI avec ChatGPT, Google avec Gemini et xAI avec Grok, se livrent une concurrence directe sur ce terrain de l'assistant personnel mobile, chacun enrichissant ses applications avec des fonctionnalités vocales, visuelles et d'intégration système. À mesure que ces outils gagnent en précision et en rapidité d'exécution sur les appareils Android, la question n'est plus de savoir si l'IA peut remplacer certains gestes du quotidien, mais à quelle vitesse les usages vont se normaliser au-delà du cercle des early adopters.

UELa France est citée dans le top 5 mondial de l'adoption de l'IA conversationnelle avec 44 % des actifs utilisateurs réguliers, rendant ces pratiques directement pertinentes pour les professionnels français en mobilité.

OutilsTuto
1 source
OpenAI prêt à tuer l’iPhone ? Son mystérieux smartphone 100 % IA intrigue déjà
624Le Big Data 

OpenAI prêt à tuer l’iPhone ? Son mystérieux smartphone 100 % IA intrigue déjà

OpenAI travaille sur un smartphone radicalement différent de tout ce qui existe actuellement. Selon l'analyste Ming-Chi Kuo, dont la fiabilité sur les feuilles de route technologiques est reconnue, la firme développe un appareil qui abandonnerait complètement le modèle des applications classiques. La production de masse est visée pour 2028, avec un possible premier aperçu dès cette année. Pour construire cet appareil, OpenAI s'appuierait sur une alliance industrielle structurée : Qualcomm et MediaTek pour les puces, Luxshare pour la fabrication à grande échelle. L'architecture serait hybride, combinant traitement local et cloud, permettant à l'IA d'analyser en permanence le contexte de l'utilisateur, position, habitudes, préférences, pour anticiper ses besoins avant même qu'il formule une demande. À la place des grilles d'icônes, un agent intelligent prendrait en charge les tâches : réservations, messages, organisation de journée, tout cela de façon quasi invisible pour l'utilisateur. L'enjeu dépasse largement le lancement d'un produit. Contrôler à la fois le matériel et le logiciel permettrait à OpenAI d'offrir une expérience cohérente et profonde que ne peut pas égaler une simple application tournant sur l'iPhone ou Android. C'est précisément le type d'intégration verticale qu'Apple a maîtrisé pendant vingt ans. Pour renforcer sa crédibilité sur ce terrain, OpenAI s'est associé à Jony Ive, l'ancien directeur du design d'Apple qui a conçu l'iPhone aux côtés de Steve Jobs, un signal fort adressé aux consommateurs habitués à des standards élevés. Si le projet aboutit, ce n'est pas seulement un téléphone qui change, c'est le paradigme dominant du smartphone depuis 2007 qui est remis en question : celui où l'utilisateur ouvre des applications, plutôt que celui où un agent agit pour lui. OpenAI entre cependant sur un marché dominé par deux géants aux ressources considérables. Apple peut s'appuyer sur plus d'un milliard d'iPhone actifs et un écosystème particulièrement verrouillé. Google, de son côté, intègre activement ses propres agents IA dans Android et avance vite. La concurrence des modèles eux-mêmes s'intensifie aussi : Anthropic avec Claude et Google avec Gemini accélèrent leurs déploiements. Ce projet s'inscrit dans une logique plus large de course au contrôle de l'interface numérique, celui qui possède le point d'entrée quotidien de l'utilisateur contrôle l'écosystème entier. Le calendrier flou et les défis industriels laissent planer une incertitude réelle sur l'exécution, mais la direction est claire : OpenAI ne veut plus seulement fournir le cerveau des appareils des autres.

OutilsOutil
1 source
Mend publie un cadre de gouvernance de la sécurité IA : inventaire des ressources, classification des risques, sécurité de la chaîne d'approvisionnement et modèle de maturité
625MarkTechPost 

Mend publie un cadre de gouvernance de la sécurité IA : inventaire des ressources, classification des risques, sécurité de la chaîne d'approvisionnement et modèle de maturité

Mend, spécialiste de la sécurité applicative, a publié un guide pratique intitulé "AI Security Governance: A Practical Framework for Security and Development Teams", destiné aux équipes de sécurité et de développement confrontées à l'essor incontrôlé des outils d'IA en entreprise. Le document part d'un constat précis : dans la quasi-totalité des organisations, les développeurs adoptent des outils comme GitHub Copilot ou des API tierces (OpenAI, Google Gemini) avant même que les équipes sécurité n'en aient connaissance. Le framework propose une réponse structurée en quatre piliers : inventaire des actifs IA, système de classification par niveau de risque, contrôle d'accès et traçabilité de la chaîne d'approvisionnement des modèles. Le coeur du dispositif repose sur un système de score allant de 5 à 15 points, évalué sur cinq dimensions : sensibilité des données, autorité décisionnelle, accès aux systèmes, exposition externe et origine dans la chaîne d'approvisionnement. Selon ce score, chaque déploiement IA est classé en Tier 1 (risque faible, revue standard), Tier 2 (risque modéré, audits comportementaux trimestriels) ou Tier 3 (risque élevé, évaluation complète, surveillance continue et plan de réponse aux incidents obligatoire). Ce cadre répond à un problème structurel croissant : le "shadow AI", c'est-à-dire les outils d'IA utilisés en production sans validation de la sécurité. Mend insiste sur le fait que la découverte de ces outils doit être non punitive, afin que les développeurs les déclarent sans crainte. Le framework souligne également que le niveau de risque d'un modèle peut changer radicalement sans modification de son code : connecter un modèle précédemment isolé à une base de données de production en écriture suffit à le faire passer du Tier 1 au Tier 3. Pour les sorties de modèles, le guide impose un filtrage actif des données réglementées (numéros de sécurité sociale, cartes bancaires, clés API) et exige que le code généré par IA soit traité comme une entrée non fiable, soumis aux mêmes analyses SAST, SCA et détection de secrets que le code écrit par des humains. Le troisième volet majeur concerne la chaîne d'approvisionnement des modèles. Mend introduit le concept d'AI Bill of Materials (AI-BOM), extension du SBOM traditionnel appliqué aux artefacts de modèles, aux jeux de données d'entraînement, aux entrées de fine-tuning et à l'infrastructure d'inférence. L'idée centrale est qu'intégrer un modèle tiers revient à hériter de la posture de sécurité de ceux qui l'ont entraîné. Ce framework s'inscrit dans un mouvement plus large de régulation de l'IA en entreprise, porté à la fois par des exigences réglementaires émergentes (EU AI Act, directives NIST) et par la multiplication des incidents liés à des modèles mal configurés ou mal cloisonnés. Mend positionne ce guide comme un point de départ accessible, non comme un programme de maturité avancée, ce qui le rend particulièrement pertinent pour les organisations qui débutent leur gouvernance IA.

UELe cadre s'aligne explicitement sur les exigences de l'EU AI Act en matière de classification des risques IA et de documentation (AI-BOM), offrant aux entreprises européennes une méthodologie concrète pour structurer leur conformité réglementaire.

SécuritéActu
1 source
Mend.io publie un cadre de gouvernance de la sécurité IA couvrant inventaire des actifs, niveaux de risque et chaîne d'approvisionnement
626MarkTechPost 

Mend.io publie un cadre de gouvernance de la sécurité IA couvrant inventaire des actifs, niveaux de risque et chaîne d'approvisionnement

La société Mend.io, spécialisée en sécurité applicative, vient de publier un guide pratique intitulé "AI Security Governance: A Practical Framework for Security and Development Teams". Ce document s'adresse directement aux responsables AppSec, chefs d'équipes ingénierie et data scientists confrontés à une prolifération incontrôlée des outils d'IA au sein de leurs organisations. Le cadre propose quatre piliers concrets : un inventaire exhaustif des actifs IA, un système de classification des risques en trois niveaux, une gestion de la chaîne d'approvisionnement des modèles, et un modèle de maturité progressif. Le système de scoring attribue à chaque déploiement IA une note de 1 à 3 sur cinq dimensions, sensibilité des données, autorité décisionnelle, accès systèmes, exposition externe et origine dans la chaîne d'approvisionnement, pour un total entre 5 et 15. Un score de 5 à 7 place l'actif en Tier 1 (revue standard), 8 à 11 en Tier 2 (audits comportementaux trimestriels), et 12 à 15 en Tier 3, qui impose une évaluation complète, une supervision continue et un plan de réponse aux incidents opérationnel avant tout déploiement. Ce framework répond à un problème devenu critique dans presque toutes les grandes entreprises : les outils d'IA entrent en production bien avant que les équipes sécurité n'en soient informées. Un développeur installe GitHub Copilot, une équipe produit intègre discrètement un modèle tiers dans une branche de fonctionnalité, un analyste interroge un LLM externe pour ses rapports. Résultat : des modèles traitent des données sensibles et prennent des décisions réelles sans aucun contrôle formalisé. Mend insiste sur un point souvent négligé : le niveau de risque d'un modèle peut passer brutalement du Tier 1 au Tier 3 sans que son code change, simplement parce qu'on lui a accordé un accès en écriture à une base de données de production ou qu'on l'a exposé à des utilisateurs externes. Le guide exige aussi d'appliquer le principe du moindre privilège aux systèmes IA exactement comme aux utilisateurs humains : clés API à portée restreinte, accès en lecture seule par défaut, et filtrage des sorties pour les données régulées comme les numéros de sécurité sociale, les cartes bancaires ou les clés d'API. Le document s'inscrit dans une tendance plus large qui voit la sécurité logicielle traditionnelle s'adapter à l'ère des modèles de fondation. Mend étend notamment le concept de SBOM (Software Bill of Materials) en introduisant un "AI-BOM", qui documente non seulement les dépendances logicielles, mais aussi les datasets d'entraînement, les entrées de fine-tuning et l'infrastructure d'inférence. Face à des outils comme OpenAI, Google Gemini, Notion AI ou Codeium désormais omniprésents dans les workflows professionnels, l'enjeu est de normaliser une gouvernance qui reste encore absente dans la majorité des organisations. Le code généré par IA est traité comme une entrée non fiable, soumise aux mêmes analyses SAST, SCA et détection de secrets que le code humain, un changement de posture qui pourrait redéfinir les standards de l'industrie dans les prochains mois.

UECe cadre de gouvernance par niveaux de risque peut aider les entreprises européennes à structurer leur mise en conformité avec l'AI Act, qui impose une classification similaire des systèmes d'IA selon leur niveau de risque.

SécuritéOpinion
1 source
627VentureBeat AI 

Von recommande tous les grands modèles IA pour l'analyse des revenus, et automatise leur combinaison

Von, une nouvelle plateforme d'intelligence artificielle lancée par l'équipe derrière Rattle, une startup spécialisée dans l'automatisation des processus, s'attaque à un paradoxe bien connu dans les entreprises tech : si les outils comme Claude Code ou Cursor ont radicalement transformé le quotidien des développeurs, les équipes commerciales restent, elles, prisonnières de silos de données, de saisies manuelles dans les CRM et de reportings approximatifs. Fondée par Sahil Aggarwal, Von se positionne non pas comme une solution ponctuelle supplémentaire, mais comme une "couche d'intelligence" unifiée pour les équipes Go-To-Market. La plateforme commence par construire un "graphe de contexte" de l'entreprise en ingérant des données structurées issues de CRM comme Salesforce et HubSpot, ainsi que des données non structurées provenant d'enregistreurs d'appels (Gong, Zoom, Chorus), de fils de messagerie et de documentation interne. Elle s'appuie ensuite sur une architecture multi-modèles : Claude d'Anthropic pour le raisonnement de haut niveau, ChatGPT pour le traitement massif de données, et Gemini de Google pour la génération de contenus créatifs comme les présentations et rapports. Lors d'une démonstration, Von a analysé 101 comptes PME pour identifier les risques de désabonnement en un peu plus de trois minutes, une tâche qu'un analyste humain effectuerait en une à deux semaines. L'enjeu est considérable pour les opérations commerciales. L'un des problèmes chroniques des équipes de vente est l'écart entre ce qui est enregistré dans un CRM et ce qui s'est réellement dit lors d'un appel client. Von résout ce problème en croisant automatiquement les transcriptions d'appels avec les données Salesforce, permettant d'identifier des incohérences dans les raisons de pertes de deals ou d'évaluer la santé d'une opportunité commerciale sur la base du sentiment réel exprimé, et non d'une mise à jour manuelle d'un commercial. La plateforme génère également des fiches de briefing pré-appel, des analyses de victoires et défaites commerciales regroupées par thèmes, et automatise les tâches administratives Salesforce à faible valeur ajoutée. En agissant comme un "Data Scientist IA" ou un "VP RevOps" virtuel, Von promet de libérer les équipes des tâches de reporting répétitives pour les recentrer sur la vente. Ce positionnement s'inscrit dans une tendance plus large de l'IA d'entreprise : après avoir conquis les workflows techniques, les grandes plateformes cherchent à s'implanter dans les fonctions commerciales et opérationnelles, historiquement moins automatisées. Von hérite de l'expertise de Rattle dans l'intégration des outils de vente, ce qui lui confère une connaissance fine des flux de données GTM. Le choix d'une stratégie "mixture of models" plutôt que d'un modèle unique reflète une maturité technique croissante dans l'industrie, où l'optimisation coût-performance dicte désormais l'architecture des solutions. La prochaine étape pour Von sera de démontrer sa capacité à s'imposer face à des acteurs établis comme Clari, Gong ou Salesforce Einstein dans un marché de l'intelligence des revenus déjà très concurrentiel et en pleine consolidation.

OutilsOutil
1 source
30 voix, des émotions, des soupirs… Google Vids vient de rendre l’IA plus humaine que jamais
628Le Big Data 

30 voix, des émotions, des soupirs… Google Vids vient de rendre l’IA plus humaine que jamais

Google a déployé le 15 avril 2026 une mise à jour majeure de Google Vids, son outil de création vidéo intégré à Workspace, en introduisant une trentaine de nouvelles voix IA expressives. Ces voix sont propulsées par Gemini 3.1 Flash TTS, un moteur de synthèse vocale de nouvelle génération capable d'intégrer des émotions, des pauses et des effets sonores directement dans la narration. Concrètement, les utilisateurs peuvent désormais insérer des instructions dans leur script, un mot lu avec enthousiasme, une pause marquée via une notation simple, voire un rire naturel, pour guider la performance vocale sans retouche audio manuelle. La mise à jour étend également la couverture linguistique de 8 à 24 langues, ajoutant notamment l'arabe, le bengali, l'hindi, le polonais, le thaï et le vietnamien. Le déploiement est progressif pour les comptes Google Workspace, Workspace Individual et les comptes personnels. Cette évolution répond à une limite longtemps reprochée aux outils de narration automatique : le ton uniforme et mécanique qui trahit immédiatement l'origine synthétique du contenu. Avec un panel de trente voix aux registres distincts, certaines dynamiques, d'autres pédagogiques ou posées, Google Vids permet d'adapter le style vocal au type de contenu sans effort supplémentaire. Une vidéo de formation peut désormais sonner différemment d'une présentation commerciale, ce qui réduit la fatigue auditive et renforce la crédibilité des productions. Pour les équipes qui utilisent Google Vids à grande échelle pour créer des tutoriels, des onboardings ou des communications internes, l'impact pratique est immédiat : moins de post-production, une meilleure rétention de l'audience, et une flexibilité narrative que les voix TTS classiques ne permettaient tout simplement pas. Google Vids, lancé en 2024 comme outil de création vidéo assistée par IA au sein de la suite Workspace, cherche à se positionner face à des concurrents comme HeyGen, Synthesia ou ElevenLabs qui ont fait de l'expressivité vocale leur argument central. L'intégration de Gemini 3.1 Flash TTS marque un tournant : Google dispose désormais d'un modèle capable de rivaliser sur ce terrain, en s'appuyant sur son écosystème d'entreprise déjà massivement déployé. L'ouverture à 24 langues signale aussi une ambition internationale claire, notamment vers les marchés asiatiques et du Moyen-Orient où la demande en contenu vidéo professionnel localisé est forte. La prochaine étape logique serait le clonage vocal personnalisé ou la synchronisation labiale, des fonctionnalités que plusieurs concurrents proposent déjà et que Google n'a pas encore annoncées pour Vids.

UELes équipes françaises utilisant Google Workspace bénéficient immédiatement de voix expressives en français et d'une réduction du temps de post-production pour leurs contenus vidéo internes.

OutilsOutil
1 source
629MarkTechPost 

Google AI publie Auto-Diagnose : un système basé sur des LLM pour diagnostiquer les échecs de tests d'intégration à grande échelle

Une équipe de chercheurs de Google a publié Auto-Diagnose, un outil basé sur le modèle Gemini 2.5 Flash qui analyse automatiquement les logs d'échecs de tests d'intégration, identifie la cause racine et poste un diagnostic structuré directement dans l'interface de revue de code interne de Google, appelée Critique. Évalué manuellement sur 71 pannes réelles couvrant 39 équipes distinctes, l'outil a correctement identifié la cause racine dans 90,14 % des cas. À grande échelle, il a déjà tourné sur 52 635 tests défaillants distincts, représentant 224 782 exécutions sur 131 130 changements de code écrits par 22 962 développeurs différents. Le taux de retours négatifs ("Not helpful") n'atteint que 5,8 %, tandis que 84,3 % des 517 retours reçus correspondent à des demandes "Please fix" de la part de reviewers, signe que les diagnostics sont jugés suffisamment fiables pour déclencher une action immédiate. L'enjeu est concret : diagnostiquer un échec de test d'intégration est structurellement plus difficile que de déboguer un test unitaire. Dans une enquête interne menée auprès de 116 développeurs Google, 38,4 % des échecs de tests d'intégration prenaient plus d'une heure à diagnostiquer, et 8,9 % plus d'une journée, contre respectivement 2,7 % et 0 % pour les tests unitaires. La raison est simple : les logs du pilote de test n'exposent généralement qu'un symptôme générique, un timeout ou une assertion échouée, tandis que l'erreur réelle est enfouie dans l'un des nombreux composants du système testé. Auto-Diagnose résout ce problème en agrégeant tous les logs, les triant par horodatage en un flux unique, puis en guidant le modèle via un protocole explicite étape par étape pour remonter à la source réelle de l'échec. Sur le plan technique, le système fonctionne sans fine-tuning : Gemini 2.5 Flash est appelé avec une température de 0,1 pour des résultats quasi-déterministes, à partir d'un prompt d'ingénierie pur incluant des contraintes négatives strictes, par exemple l'interdiction de tirer une conclusion si les logs du composant fautif sont absents. Chaque exécution consomme en moyenne 110 617 tokens en entrée et produit 5 962 tokens en sortie, avec une latence médiane de 56 secondes et un 90e percentile à 346 secondes, suffisamment rapide pour que le développeur voie le diagnostic avant de changer de contexte. Ce travail illustre une tendance plus large chez les grands groupes technologiques : utiliser les LLM non pas pour écrire du code, mais pour absorber la complexité observationnelle des systèmes distribués, là où l'humain peine à tenir l'ensemble des signaux en tête simultanément.

RecherchePaper
1 source
Le nouveau modèle de Google rend les cerveaux robotiques un peu plus intelligents
630The Information AI 

Le nouveau modèle de Google rend les cerveaux robotiques un peu plus intelligents

Google DeepMind a publié cette semaine Gemini Robotics-ER-1.6, un nouveau modèle de vision et de langage conçu pour aider les robots à interpréter leur environnement. Pour illustrer ses capacités, Boston Dynamics, qui dispose d'un accord pour intégrer Gemini dans ses robots humanoïdes, a publié une vidéo de ses robots quadrupèdes utilisant le modèle pour lire un thermomètre lors d'une inspection dans une installation industrielle. Selon les benchmarks internes de Google, les gains restent modestes sur un seul flux caméra : le modèle n'améliore que marginalement la capacité du robot à détecter la fin d'une tâche par rapport aux versions précédentes. En revanche, les performances progressent nettement lorsque le robot exploite plusieurs flux caméra simultanément. C'est précisément là que réside l'enjeu pratique : la majorité des environnements robotiques industriels, qu'il s'agisse d'usines ou d'entrepôts, s'appuient sur plusieurs points de vue combinés, comme une caméra en hauteur et une caméra fixée sur le bras du robot. Le système doit être capable de fusionner ces perspectives pour construire une compréhension cohérente de ce qu'il accomplit et savoir quand la tâche est terminée. Ce lancement s'inscrit dans une course intense entre les grands laboratoires d'IA pour doter les robots d'une intelligence de perception plus robuste. Google DeepMind et Boston Dynamics ont formalisé leur partenariat autour de Gemini pour les robots humanoïdes, signalant une convergence entre les modèles de fondation et la robotique physique. Si les progrès annoncés restent incrémentaux, l'amélioration sur les configurations multi-caméras est directement applicable aux déploiements industriels existants, ce qui pourrait accélérer l'adoption de robots autonomes dans des environnements de travail réels. Les prochaines versions du modèle seront à surveiller pour évaluer si ces gains se traduisent en performances significatives sur des tâches complexes en conditions réelles.

RobotiqueActu
1 source
631MIT Technology Review 

L'IA d'entreprise comme couche d'exploitation

La vraie ligne de fracture dans l'IA d'entreprise n'est pas celle que l'on suit habituellement dans les médias. Pendant que le débat public se focalise sur les benchmarks des modèles fondateurs, GPT contre Gemini, scores de raisonnement, gains marginaux de performance, l'avantage décisif se joue ailleurs : dans la couche opérationnelle, c'est-à-dire l'ensemble formé par les logiciels de workflow, la capture de données, les boucles de rétroaction et la gouvernance qui s'intercale entre les modèles d'IA et le travail réel. Des acteurs comme OpenAI et Anthropic vendent l'intelligence comme un service : on a un problème, on appelle une API, on obtient une réponse. Cette intelligence est généraliste, largement sans mémoire d'une session à l'autre, et de plus en plus interchangeable. À l'opposé, les organisations établies ont la possibilité de traiter l'IA comme une couche opérationnelle permanente : chaque exception, chaque correction, chaque validation humaine devient un signal d'apprentissage, et l'intelligence s'améliore à mesure que la plateforme absorbe davantage de travail. Ce modèle inverse la relation traditionnelle entre humains et machines. Dans une organisation de services classique, les opérateurs utilisent des logiciels pour effectuer un travail d'expert : la technologie est le médium, le jugement humain est le produit. Une plateforme pensée nativement pour l'IA renverse cette logique : le système ingère un problème, applique la connaissance accumulée du domaine, exécute de manière autonome ce qu'il peut traiter avec une haute confiance, et renvoie vers des experts humains uniquement les sous-tâches qui requièrent un jugement que le système ne maîtrise pas encore. Cette inversion n'est pas qu'un simple redesign d'interface, elle exige une matière première que les startups ne peuvent pas fabriquer rapidement : des données opérationnelles propriétaires, une large base d'experts dont les décisions quotidiennes génèrent des signaux d'entraînement, et une connaissance tacite accumulée sur des années quant à la façon dont le travail complexe se fait réellement. C'est là où réside le véritable enjeu stratégique de la décennie. Le récit dominant affirme que les startups agiles vont surpasser les acteurs établis en construisant des systèmes AI-native from scratch. Si l'IA était avant tout un problème de modèles, cette thèse tiendrait. Mais dans beaucoup de secteurs d'entreprise, c'est un problème de systèmes, intégrations, permissions, évaluation, gestion du changement, où l'avantage revient à ceux qui sont déjà ancrés dans des workflows à fort volume et à forts enjeux. La société Ensemble illustre cette approche avec une stratégie de "distillation de connaissance" : transformer l'expertise tacite et périssable des meilleurs opérateurs en signaux réutilisables, puis réinjecter ces résultats dans les workflows pour que le système continue à progresser. Les ingrédients existent déjà chez les acteurs historiques ; la question est de savoir qui saura les convertir en avantage compétitif durable avant que la fenêtre ne se referme.

BusinessOpinion
1 source
Paris sportifs : Ce qui risque de vous arriver en demandant conseil à l’IA
632Le Big Data 

Paris sportifs : Ce qui risque de vous arriver en demandant conseil à l’IA

Une start-up londonienne, General Reasoning, a publié une étude baptisée « KellyBench » qui met en lumière les limites des grandes intelligences artificielles face à un défi financier concret : les paris sportifs. Huit modèles issus de Google, OpenAI, Anthropic et xAI ont été soumis à une simulation de la saison 2023-2024 de la Premier League anglaise. Chaque système disposait de données historiques, de statistiques d'équipes et de joueurs, et devait élaborer des stratégies de mise capables de générer des profits tout en limitant les risques, sans accès à Internet et en s'adaptant aux informations fournies au fil des matchs. Les résultats sont sans appel : aucun des modèles testés n'a réussi à rester rentable sur la durée. Le meilleur performer, Claude Opus 4.6 d'Anthropic, affiche tout de même une perte moyenne de 11 %, avec une seule tentative frôlant l'équilibre. Grok 4.20 de xAI a fait faillite dès son premier essai, tandis que Gemini 3.1 Pro de Google a enregistré un gain ponctuel de 34 % avant de s'effondrer lors d'une autre tentative. Plusieurs systèmes ont accumulé des pertes importantes, et tous ont performé en dessous de participants humains placés dans les mêmes conditions simulées. Ces résultats éclairent une limite fondamentale des IA actuelles : leur efficacité chute dès qu'elles quittent les environnements stables et bien définis. Si ces systèmes excellent sur des tâches structurées comme la programmation, l'analyse de données ou les examens standardisés, ils peinent à gérer des dynamiques imprévisibles sur le long terme, là où les variables changent en permanence et où les décisions doivent intégrer du risque réel. Pour les investisseurs, les parieurs ou toute personne envisageant de déléguer des décisions financières à une IA, le message est clair : la robustesse affichée dans les benchmarks classiques ne se traduit pas en performance dans des contextes réels et mouvants. Ross Taylor, directeur général de General Reasoning et ancien chercheur chez Meta AI, souligne que l'engouement actuel pour l'automatisation tend à masquer cette réalité plus nuancée. Les benchmarks traditionnels, trop statiques, ne capturent pas la complexité du monde réel, ce qui crée une illusion de compétence universelle. Cette étude, encore non évaluée par des pairs, s'inscrit dans un débat plus large sur la façon dont on mesure les capacités des IA : les tests actuels favorisent les domaines où ces systèmes brillent, tout en occultant leurs lacunes sur des tâches dynamiques et à haute incertitude. La prochaine étape pour le secteur sera de concevoir des évaluations plus représentatives, capables de révéler non seulement ce que les IA savent faire, mais aussi ce qu'elles ne maîtrisent pas encore.

UECette étude avertit les entreprises et investisseurs européens contre la délégation de décisions financières à des IA, dont les performances réelles restent inférieures aux capacités humaines dans des contextes dynamiques et incertains.

RecherchePaper
1 source
Gemma 4 : le nouveau modèle d’IA de Google s’invite sur Nintendo Switch
633Frandroid 

Gemma 4 : le nouveau modèle d’IA de Google s’invite sur Nintendo Switch

Une développeuse a réussi à faire tourner Gemma 4, le modèle d'intelligence artificielle open source de Google, directement sur une Nintendo Switch, sans connexion à un serveur distant. L'exploit repose sur la version la plus compacte du modèle, publiée par Google en avril 2025 dans le cadre de sa gamme Gemma 4, qui décline plusieurs tailles allant de 1 à 27 milliards de paramètres. C'est la variante 1B, soit un milliard de paramètres, qui a été portée sur la console de Nintendo, dont le matériel repose sur une puce NVIDIA Tegra X1 et 4 Go de RAM partagée. Cet accomplissement illustre la progression rapide de la miniaturisation des modèles de langage et leur capacité à s'exécuter sur du matériel grand public, bien loin des serveurs GPU qui équipent habituellement ce type de charge de travail. Pour les développeurs embarqués et les constructeurs d'appareils connectés, cela ouvre des perspectives concrètes : intégrer des capacités d'inférence locale dans des terminaux à faible consommation, sans dépendance au cloud et sans coût de bande passante. Google a lancé la famille Gemma comme alternative ouverte à ses modèles propriétaires Gemini, ciblant explicitement les usages sur appareil. La Switch, conçue en 2017, n'était évidemment pas pensée pour l'IA générative, ce qui rend la démonstration d'autant plus symbolique. Elle s'inscrit dans une tendance plus large de course à l'efficience, où des acteurs comme Meta avec Llama, Microsoft avec Phi ou Apple avec ses modèles on-device cherchent tous à repousser les limites du possible sur silicium contraint.

LLMsActu
1 source
Les chatbots IA progressent sept fois plus vite que les réseaux sociaux, mais restent quatre fois moins fréquentés
634The Decoder 

Les chatbots IA progressent sept fois plus vite que les réseaux sociaux, mais restent quatre fois moins fréquentés

Le trafic vers les chatbots d'intelligence artificielle croît sept fois plus vite que celui des réseaux sociaux, mais reste quatre fois inférieur en volume total, selon une analyse publiée par Similarweb. Ces données portent sur les principales plateformes de conversation IA, dont ChatGPT d'OpenAI, Gemini de Google et Claude d'Anthropic, et révèlent des différences notables entre ces deux catégories de services numériques, notamment dans les habitudes d'utilisation selon les appareils et les comportements des utilisateurs. Ce rythme de croissance exceptionnel illustre l'adoption massive et rapide des outils d'IA conversationnelle par le grand public, mais l'écart de volume avec les réseaux sociaux rappelle que ces derniers restent ancrés dans le quotidien numérique de milliards de personnes. Pour les acteurs du secteur tech, cela signifie que le marché de l'IA conversationnelle est encore loin de sa maturité et que les marges de progression restent considérables. La question des usages par appareil est particulièrement stratégique : les chatbots sont aujourd'hui davantage utilisés sur ordinateur, là où les réseaux sociaux dominent sur mobile. Cette dynamique s'inscrit dans un contexte de compétition intense entre les grandes plateformes d'IA, qui multiplient les mises à jour et les nouvelles fonctionnalités pour capter des parts de marché. Les réseaux sociaux, eux, ont bénéficié de deux décennies d'intégration dans les usages quotidiens. Si la trajectoire actuelle se maintient, l'écart de trafic entre les deux catégories pourrait se réduire significativement dans les prochaines années, à mesure que l'IA s'intègre dans davantage d'applications et de flux de travail professionnels.

SociétéOutil
1 source
OpenAI veut se « recentrer », mais s’offre le podcast préféré de la Silicon Valley
63501net 

OpenAI veut se « recentrer », mais s’offre le podcast préféré de la Silicon Valley

OpenAI a annoncé le rachat du podcast "All-In", l'émission tech la plus écoutée de la Silicon Valley, dans un mouvement qui surprend au moment même où l'entreprise affiche des ambitions de recentrage stratégique. Cette acquisition intervient après une série de revers coûteux : l'arrêt de Sora, son générateur vidéo phare, l'échec d'un partenariat avec Disney, et près d'un milliard de dollars de pertes enregistrées sur des projets abandonnés en 2025. Cette décision illustre une tension croissante au sein d'OpenAI entre la rhétorique de la rigueur et une réalité d'expansion tous azimuts. Posséder le media de référence de l'élite tech américaine offre à Sam Altman un levier d'influence considérable sur les narratives qui façonnent l'industrie, les investisseurs et les régulateurs. Pour les utilisateurs et les concurrents, cela signale qu'OpenAI joue désormais sur le terrain de la communication autant que sur celui de la recherche. Ce rachat s'inscrit dans une période charnière pour OpenAI, qui doit à la fois justifier sa valorisation de plusieurs centaines de milliards de dollars, résister à la montée en puissance de Gemini et de Claude, et gérer les critiques sur sa transformation en entité à but lucratif. Acquérir une voix influente dans l'écosystème tech pourrait être une manière de consolider son image au moment où son leadership est le plus contesté.

Z.ai lance GLM-5V-Turbo : un modèle multimodal de vision et de code optimisé pour les workflows d'ingénierie à base d'agents
636MarkTechPost 

Z.ai lance GLM-5V-Turbo : un modèle multimodal de vision et de code optimisé pour les workflows d'ingénierie à base d'agents

Zhipu AI (Z.ai), laboratoire d'intelligence artificielle chinois, a lancé GLM-5V-Turbo, un nouveau modèle de vision multimodale spécialement conçu pour la génération de code et les workflows d'ingénierie logicielle. Ce modèle se distingue par une architecture dite de fusion multimodale native, associant un encodeur visuel CogViT à une architecture MTP (Multi-Token Prediction), avec une fenêtre de contexte de 200 000 tokens. Il est capable de traiter simultanément des images, des vidéos, des maquettes de design et des documents techniques complexes, tout en produisant du code syntaxiquement rigoureux. Son entraînement repose sur une technique de reinforcement learning conjoint sur plus de 30 tâches distinctes couvrant le raisonnement STEM, l'ancrage visuel, l'analyse vidéo et l'utilisation d'outils externes. Ce lancement répond à un problème structurel bien connu dans le domaine des modèles vision-langage : le « effet de balançoire », où les gains en perception visuelle se font au détriment des capacités de programmation logique. En optimisant conjointement ces deux dimensions, GLM-5V-Turbo ouvre la voie à des agents d'interface graphique (GUI agents) véritablement opérationnels — des systèmes capables de « voir » un écran et d'en déduire les actions ou le code nécessaire pour y interagir. Concrètement, cela permet à un développeur de soumettre une capture d'écran d'un bug ou une maquette de fonctionnalité, et d'obtenir directement le code correspondant, sans passer par une description textuelle intermédiaire. L'intégration avec OpenClaw, framework open source pour agents GUI, et avec Claude Code, l'outil de programmation assistée d'Anthropic, renforce son positionnement dans des pipelines d'automatisation logicielle à haute capacité. Ce modèle s'inscrit dans une compétition mondiale de plus en plus intense autour des modèles multimodaux orientés code, où des acteurs comme Google (Gemini), OpenAI (GPT-4o) et Anthropic (Claude) investissent massivement. La stratégie de Z.ai se distingue par une spécialisation assumée : plutôt que de viser un usage généraliste, GLM-5V-Turbo cible explicitement les workflows agentiques, en s'intégrant dès le départ dans des écosystèmes d'outils existants. Cette approche de « deep adaptation » pourrait s'avérer décisive pour les équipes d'ingénierie cherchant à automatiser des tâches visuellement complexes — déploiement d'environnements, analyse de sessions enregistrées, génération de code à partir de maquettes — sans sacrifier la précision logique indispensable au développement logiciel professionnel.

LLMsActu
1 source
Créez avec Veo 3.1 Lite, notre modèle de génération vidéo le plus accessible
637Google AI Blog 

Créez avec Veo 3.1 Lite, notre modèle de génération vidéo le plus accessible

Google a mis en disponibilité Veo 3.1 Lite, sa nouvelle version allégée de modèle de génération vidéo, en accès payant via l'API Gemini et en test gratuit sur Google AI Studio. Présenté comme le modèle de génération vidéo le plus économique de la gamme, il s'adresse aux développeurs et entreprises souhaitant intégrer la création vidéo IA dans leurs applications sans supporter les coûts de la version complète Veo 3.1. Ce lancement répond à une demande croissante de solutions vidéo IA accessibles pour les équipes produit et les startups. En proposant une alternative moins coûteuse, Google ouvre la génération vidéo à une base bien plus large de développeurs, au-delà des grandes entreprises capables d'absorber les tarifs premium. La disponibilité directe via l'API Gemini facilite l'intégration dans des pipelines existants. Veo 3.1 Lite s'inscrit dans la stratégie de Google de démocratiser ses outils d'IA générative face à la concurrence de Sora d'OpenAI et Runway. La famille Veo, lancée en 2024, monte progressivement en accessibilité après avoir ciblé initialement les partenaires enterprise. La phase de "paid preview" suggère une disponibilité générale prochaine, avec des tarifs définitifs à préciser.

UELes développeurs et startups européens peuvent désormais intégrer la génération vidéo IA dans leurs pipelines applicatifs à moindre coût via l'API Gemini.

OutilsOutil
1 source
Microsoft intègre de nouvelles capacités d'IA dans Copilot Researcher
638AI Business 

Microsoft intègre de nouvelles capacités d'IA dans Copilot Researcher

Microsoft a annoncé de nouvelles fonctionnalités pour Copilot Researcher, son outil de recherche approfondie intégré à Microsoft 365 Copilot, avec pour objectif d'améliorer la précision et la fiabilité des résultats dans les environnements professionnels. Ces mises à jour ciblent directement les flux de travail en entreprise, où l'exactitude des informations produites par l'IA est un enjeu critique. Pour les organisations déjà abonnées à Microsoft 365 Copilot, ces améliorations signifient que l'outil peut désormais mieux gérer des requêtes complexes nécessitant plusieurs étapes de raisonnement et de synthèse. La fiabilité accrue réduit le risque d'hallucinations ou de réponses imprécises, un point de friction majeur qui freinait l'adoption de l'IA générative dans des contextes professionnels sensibles. Copilot Researcher avait été lancé début 2025 en s'appuyant sur les capacités de recherche approfondie développées par OpenAI, dans le cadre du partenariat stratégique entre les deux entreprises. Microsoft cherche à consolider sa position face à la concurrence de Google avec Gemini for Workspace et de Salesforce avec Agentforce, en faisant de la fiabilité son principal argument de différenciation auprès des entreprises hésitant encore à intégrer l'IA dans leurs processus décisionnels.

UELes entreprises européennes abonnées à Microsoft 365 Copilot peuvent tirer parti d'une fiabilité accrue pour leurs flux de travail sensibles, réduisant le frein à l'adoption lié aux hallucinations.

OutilsOutil
1 source
Personnaliser l'expérience spectateur avec un assistant cinéma IA à base d'agents — Amazon Bedrock AgentCore et Nova Sonic 2.0
639AWS ML Blog 

Personnaliser l'expérience spectateur avec un assistant cinéma IA à base d'agents — Amazon Bedrock AgentCore et Nova Sonic 2.0

Amazon a dévoilé une architecture d'assistant IA conversationnel pour les plateformes de streaming vidéo, combinant Amazon Bedrock AgentCore et le nouveau modèle vocal Amazon Nova Sonic 2.0. Le système permet deux cas d'usage principaux : des recommandations de films personnalisées en temps réel selon l'humeur et le contexte de l'utilisateur, et une assistance contextuelle en cours de visionnage — permettant par exemple de demander à voix haute « qui est cet acteur ? » ou « résume ce qui vient de se passer » sans quitter le film. L'infrastructure repose sur AWS Fargate pour le traitement serveur, Amazon CloudFront et S3 pour le frontend, Amazon Cognito pour l'authentification, et OpenSearch combiné à S3 Vector pour la recherche sémantique. La communication entre le client et le serveur s'effectue via WebSocket avec validation de token JWT, tandis que le modèle vocal Nova Sonic 2.0 gère le streaming bidirectionnel en temps réel via un protocole RPC Smithy. Ce type de système représente un changement de paradigme pour les services de streaming : là où les moteurs de recommandation classiques — basés sur le filtrage collaboratif ou par contenu — se contentent de prolonger les habitudes passées, l'approche agentique intègre le contexte immédiat. Un utilisateur qui vient de regarder « Les Évadés » et veut se détendre ne se verra pas proposer un autre drame carcéral, mais quelque chose d'adapté à son état d'esprit exprimé en langage naturel. Pour les plateformes, cela ouvre la voie à une réduction du taux de désabonnement lié à la friction de découverte, l'une des principales causes d'attrition dans le secteur. Pour les utilisateurs, c'est l'équivalent d'un programmateur culturel personnel disponible en permanence. Le projet s'inscrit dans la montée en puissance des architectures dites « agentiques », où les modèles de langage ne se contentent plus de répondre à des requêtes isolées mais orchestrent des chaînes d'outils complexes. Amazon positionne ici son écosystème — Bedrock AgentCore, le protocole MCP (Model Context Protocol) pour exposer des fonctions Lambda comme outils d'agent, et Nova Sonic pour la voix — comme une pile verticale intégrée pour ce type d'application. C'est une réponse directe aux initiatives similaires de Google (avec Gemini Live) et d'OpenAI (avec les capacités vocales temps réel de GPT-4o). Le code source de la démonstration est disponible sur GitHub, signalant une stratégie d'adoption par les développeurs avant un déploiement commercial plus large. La bataille pour devenir l'infrastructure standard des expériences média augmentées par l'IA ne fait que commencer.

UELes plateformes de streaming européennes disposant d'une infrastructure AWS peuvent expérimenter cette architecture, mais aucune adoption ou réglementation spécifique à la France ou à l'UE n'est mentionnée.

OutilsOutil
1 source
Actualité : Apnée du sommeil : après 25 ans de ronflements et 5 spécialistes dépassés, Claude lui sauve probablement la vie
640Les Numériques IA 

Actualité : Apnée du sommeil : après 25 ans de ronflements et 5 spécialistes dépassés, Claude lui sauve probablement la vie

Le 26 mars 2026, un post publié sur le subreddit r/ClaudeAI a rapidement franchi les 4 000 votes et généré près de 960 commentaires. Son auteur, un internaute indien, y décrit comment il a soumis l'intégralité du dossier médical de son oncle à Claude, après 25 ans de ronflements chroniques, une insuffisance rénale progressive et cinq spécialistes qui n'avaient pas su relier les symptômes entre eux. En quelques minutes, le modèle d'Anthropic a identifié une apnée obstructive du sommeil sévère non diagnostiquée comme fil conducteur probable de l'ensemble des complications — une conclusion que personne dans la chaîne médicale n'avait formalisée. L'impact est immédiat et concret : le patient a depuis pu consulter un pneumologue armé d'une hypothèse précise, ce qui a accéléré la prescription d'une polysomnographie. Pour des millions de patients atteints d'apnée non diagnostiquée — estimés entre 80 et 90 % des cas selon l'American Academy of Sleep Medicine — ce type d'usage illustre une nouvelle fonction des LLMs : non pas remplacer le médecin, mais synthétiser des dossiers fragmentés que le système de soins n'a pas le temps de recroiser. Ce récit s'inscrit dans une tendance documentée depuis 2024 : des patients ou leurs proches utilisent de plus en plus Claude, GPT-4 ou Gemini comme deuxième avis informel face à des diagnostics bloqués. Anthropic n'a pas commenté ce cas spécifique, mais la viralité du post relance le débat sur la responsabilité médicale des IA génératives, leur place dans le parcours de soins, et les garde-fous réglementaires encore largement absents dans ce domaine.

UEL'absence de cadre réglementaire européen pour les usages médicaux informels de l'IA soulève des questions de responsabilité juridique et de sécurité des patients directement pertinentes dans le contexte de l'AI Act.

SociétéOpinion
1 source
Google s'associe à Agile Robots dans sa nouvelle offensive en robotique IA
641AI Business 

Google s'associe à Agile Robots dans sa nouvelle offensive en robotique IA

Google s'est associé à Agile Robots dans le cadre d'un nouveau partenariat stratégique qui verra les modèles d'IA Gemini intégrés directement dans le matériel robotique du fabricant allemand. Cette collaboration marque une nouvelle étape dans la volonté de Google de déployer ses technologies d'intelligence artificielle dans des environnements physiques réels, au-delà des applications logicielles. En embarquant Gemini dans des robots capables d'agir dans le monde réel, Google franchit un cap important vers une IA incarnée et opérationnelle. La course à la robotique dopée à l'IA s'intensifie, avec des acteurs comme OpenAI, Microsoft et Amazon qui multiplient eux aussi leurs investissements dans ce secteur en pleine effervescence.

UEAgile Robots, fabricant allemand, se retrouve au cœur de la course mondiale à la robotique IA grâce à ce partenariat, renforçant potentiellement la compétitivité d'un acteur européen face aux géants américains et asiatiques.

RobotiqueActu
1 source
Automatiser les flux de travail financiers complexes avec l'IA multimodale
642AI News 

Automatiser les flux de travail financiers complexes avec l'IA multimodale

Les institutions financières adoptent des pipelines IA multimodaux pour automatiser le traitement de documents complexes comme les relevés de courtage, combinant des outils de parsing (LlamaParse) avec des LLMs pour extraire tableaux et données structurées — avec une amélioration de 13 à 15 % par rapport au traitement brut. L'architecture recommandée repose sur deux modèles en parallèle : Gemini 2.5 Pro pour la compréhension des mises en page complexes, et Gemini 2.0 Flash pour la génération des résumés, réduisant la latence globale du pipeline. Cette approche événementielle et scalable améliore l'efficacité opérationnelle et la gestion des risques, mais nécessite des protocoles de gouvernance stricts car les modèles peuvent produire des erreurs.

OutilsOutil
1 source
Google teste un bouton pour discuter avec son IA directement dans Chrome
643Siècle Digital 

Google teste un bouton pour discuter avec son IA directement dans Chrome

Google expérimente sur Chrome mobile (iPhone) un bouton « Ask Gemini » intégré directement dans le navigateur, visant à faire de l'IA une fonctionnalité native plutôt qu'un outil annexe. Cette initiative s'inscrit dans la tendance générale d'accélération de l'intégration de l'IA dans les navigateurs web.

UELes utilisateurs européens de Chrome sur iPhone pourraient bénéficier de cette fonctionnalité, mais son déploiement en UE reste soumis aux contraintes du DMA.

OutilsOutil
1 source
Luma Labs lance Uni-1 : le modèle Transformer autorégressif qui raisonne par intentions avant de générer des images
644MarkTechPost 

Luma Labs lance Uni-1 : le modèle Transformer autorégressif qui raisonne par intentions avant de générer des images

Luma Labs vient de lancer Uni-1, un modèle de génération d'images basé sur une architecture transformer autorégressif decoder-only, qui se distingue des modèles de diffusion classiques (comme Stable Diffusion ou Flux) en traitant texte et images comme une séquence unifiée de tokens. Avant de générer une image, le modèle effectue une phase de raisonnement pour comprendre les intentions spatiales et logiques de l'instruction, ce qui lui permet de surpasser Flux Max et Gemini sur les benchmarks RISEBench et ODinW-13. Accessible sur lumalabs.ai/uni-1 au tarif d'environ 0,10 $ par image, Uni-1 accepte des instructions en langage naturel sans nécessiter de prompt engineering élaboré.

OutilsActu
1 source
645Le Big Data 

La presse et l’IA : l’importance de la visibilité médiatique à l’heure des moteurs d’Intelligence Artificielle

Constance Blanc, fondatrice d'Évidemment l'Agence, alerte sur un nouvel enjeu pour les entreprises : sans présence médiatique, elles risquent de disparaître des réponses des IA génératives comme GPT-4, Claude ou Gemini. Ces modèles privilégient les sources journalistiques car elles offrent trois garanties — éditorialisation, attribution et validation — que les algorithmes reconnaissent comme des signaux de confiance (Trust Signals). En 2026, la visibilité dans la presse devient donc un prérequis à l'autorité numérique, supplantant le SEO classique.

UELes entreprises françaises doivent repenser leur stratégie de relations presse pour maintenir leur visibilité dans les réponses des moteurs d'IA génératifs.

OutilsOpinion
1 source
646Numerama 

Adieu Figma ? Google réinvente Stitch pour vous permettre de designer des apps à la voix

Google Labs a annoncé le 18 mars 2026 une refonte de Stitch, son outil de design d'interfaces web et mobiles basé sur les modèles Gemini. Stitch permet de générer des interfaces à partir de prompts texte, d'images ou de croquis. La nouveauté majeure est l'ajout de la commande vocale pour designer des applications.

OutilsOutil
1 source
Le vrai risque de l’IA générative : pas le remplacement, mais l’atrophie cognitive
647Le Big Data 

Le vrai risque de l’IA générative : pas le remplacement, mais l’atrophie cognitive

Le vrai risque de l'IA générative (ChatGPT, Copilot, Gemini, Claude) n'est pas le remplacement des travailleurs, mais l'atrophie cognitive : en fournissant des résultats sans effort, elle crée une illusion de maîtrise sans consolider les compétences réelles. Nicolas Bourgerie, CEO de Teach Up, oppose à cette logique une IA pédagogique qui entraîne l'apprenant plutôt que de le substituer, structurant l'effort et renforçant la compréhension sur le long terme. Le danger est particulièrement élevé dans les métiers où le jugement humain est irremplaçable — management, conformité réglementaire, relation client complexe, vente à forte valeur — notamment dans les secteurs régulés comme la banque, l'assurance et l'automobile.

UETeach Up, entreprise française, positionne son offre d'IA pédagogique dans les secteurs régulés (banque, assurance) particulièrement exposés au risque d'atrophie cognitive en France et en Europe.

ÉthiqueOpinion
1 source
Google DeepMind présente Aletheia : L'agent AI passant des compétitions mathématiques aux découvertes de recherche professionnelle entièrement autonomes
648MarkTechPost 

Google DeepMind présente Aletheia : L'agent AI passant des compétitions mathématiques aux découvertes de recherche professionnelle entièrement autonomes

Google DeepMind a présenté Aletheia, un agent AI spécialisé pour relier les compétitions mathématiques à la recherche professionnelle. Aletheia, basé sur Gemini Deep Think, utilise une architecture d'agencement (Generator, Verifier, Reviser) pour générer, vérifier et corriger des solutions en langage naturel. Aletheia a atteint 95.1% d'exactitude sur le banc de tests IMO-Proof Advanced et a contribué à plusieurs publications académiques, y compris la résolution autonome de 4 problèmes ouverts. DeepMind propose une classification pour les contributions mathématiques de l'IA, allant de la collaboration humain-IA (niveau 1) à l'autonomie quasi complète (niveau 2).

RechercheOutil
1 source
Meta rachète Moltbook, le réseau social pour IA : génie ou move idiot comme le métavers ?
649Le Big Data 

Meta rachète Moltbook, le réseau social pour IA : génie ou move idiot comme le métavers ?

Meta a acquis Moltbook, une plateforme expérimentale de type Reddit où des agents IA (connectés via OpenClaw à ChatGPT, Claude, Gemini, Grok) publient et interagissent entre eux — les fondateurs Matt Schlicht et Ben Parr rejoignent Meta Superintelligence Labs. L'objectif de Meta serait de créer un annuaire permanent d'agents IA capables de collaborer automatiquement sur des tâches complexes. La plateforme avait fait polémique suite à un post viral suggérant que des agents créaient un langage chiffré secret, mais des chercheurs en cybersécurité ont révélé que c'était surtout dû à de graves failles de sécurité exposant des données d'authentification.

BusinessActu
1 source
Guide : quelle IA utiliser à l'ère des agents autonomes
650One Useful Thing 

Guide : quelle IA utiliser à l'ère des agents autonomes

Depuis l'émergence de ChatGPT, les guides d'utilisation de l'IA se succèdent — mais celui-ci marque une rupture fondamentale. Jusqu'à très récemment, « utiliser l'IA » signifiait dialoguer avec un chatbot dans une fenêtre de conversation. Aujourd'hui, il est devenu pratique d'utiliser l'IA comme un agent autonome : on lui confie une tâche, elle l'exécute en mobilisant des outils, en enchaînant des étapes, sans intervention humaine à chaque tour. Cette évolution oblige à penser l'IA à travers trois dimensions distinctes : les modèles (le cerveau), les applications (le produit qu'on utilise), et le harnais (le système qui donne au modèle la capacité d'agir). Les grands modèles du moment sont GPT-5.2/5.3 d'OpenAI, Claude Opus 4.6 d'Anthropic et Gemini 3 Pro de Google — les versions évoluant désormais à un rythme bien plus rapide qu'auparavant. Pour accéder à ces modèles avancés, il faut généralement débourser au moins 20 dollars par mois. Cette distinction modèle/application/harnais est devenue essentielle car le même modèle peut produire des résultats radicalement différents selon l'environnement dans lequel il opère. Claude Opus 4.6 utilisé dans une simple fenêtre de chat n'a rien à voir avec Claude Opus 4.6 intégré dans Claude Code, qui dispose d'un ordinateur virtuel, d'un navigateur web et d'un terminal, et peut autonomement rechercher, construire et tester un site web pendant des heures. De même, GPT-5.2 en mode conversation classique diffère fondamentalement de GPT-5.2 Thinking, capable de naviguer sur le web et de produire une présentation complète. Des outils comme Manus — récemment racheté par Meta — ou OpenClaw ont d'ailleurs émergé principalement comme des harnais, capables d'envelopper plusieurs modèles pour orchestrer des tâches complexes. La question « quel outil IA utiliser ? » est donc devenue bien plus difficile à répondre, car la réponse dépend désormais intimement de ce qu'on cherche à accomplir. Ce changement de paradigme s'inscrit dans une accélération brutale du secteur depuis fin 2024. Les performances des grands modèles se sont rapprochées au point que les écarts de capacité brute entre GPT, Claude et Gemini s'estompent — mais les harnais creusent de nouveaux écarts selon les usages. Pour un développeur, Claude Code offre une autonomie inédite sur des projets logiciels entiers. Pour un professionnel du conseil ou de la communication, un harnais orienté recherche et présentation sera plus pertinent. La compétition ne se joue plus seulement sur les benchmarks des modèles, mais sur la qualité de l'orchestration, la fiabilité des outils fournis et la confiance accordée à l'agent pour agir de manière autonome — ce qui soulève des questions nouvelles sur le contrôle, la sécurité et la responsabilité dans l'usage quotidien de ces systèmes.

OutilsOutil
1 source