Aller au contenu principal
Les constructions de Ben : #2
OutilsBen's Bites · 1 min de lecture

Les constructions de Ben : #2

Source originale ↗·

Ben Tossell, fondateur de la newsletter Ben's Bites, publie le deuxième volet de son journal de builder, révélant une semaine contrastée : peu productive sur le plan technique, mais riche en observations de terrain. De retour dans sa ville natale de Cardiff pour intervenir dans son ancienne école, il a constaté avec inquiétude que la quasi-totalité des 16-18 ans interrogés n'utilisent ChatGPT que pour leurs devoirs scolaires, aucun ne s'en sert pour construire quoi que ce soit.

Ce constat l'a conforté dans une direction stratégique déjà esquissée : former les non-développeurs à créer avec l'IA. Il annonce le lancement de "Fork Off", une formation ouverte une fois par trimestre pour apprendre à des non-codeurs à concevoir des applications, des automatisations et des agents IA. La cadence trimestrielle est délibérée : dans un secteur qui évolue aussi vite, elle lui permet de maintenir le contenu à jour sans perturber les participants en cours de formation.

Côté réalisations techniques, Tossell a développé une application web de recherche dans les favoris X (Twitter), outil qu'il utilise désormais comme source principale pour ses contenus. Il a également tenté d'améliorer son agent de tri d'emails via Replit Agent 4, qu'il juge sévèrement, "💩" est son verdict, avant d'abandonner au profit de ses outils habituels (Droid et Pi). Son stack intègre désormais Chops pour gérer les compétences IA sur Mac, et Claude Cowork, qu'il utilise quotidiennement malgré ses limites aux seuls modèles Anthropic.

Sur la question de l'écriture assistée par IA, Tossell adopte une posture nuancée : il explore des outils anti-générique comme Tropes et les AI style guides d'Every, tout en s'appuyant sur le corpus de Jack Butcher pour générer une première ébauche de copie pour Fork Off. Une approche pragmatique qui illustre bien la tension entre gain de productivité et préservation d'une voix authentique.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Amazon Bedrock AgentCore Evaluations : construire des agents IA fiables
1AWS ML Blog 

Amazon Bedrock AgentCore Evaluations : construire des agents IA fiables

Amazon a lancé AgentCore Evaluations, un service entièrement géré intégré à Amazon Bedrock, conçu pour mesurer la performance des agents d'IA tout au long de leur cycle de développement. Le problème que ce service cherche à résoudre est bien documenté dans l'industrie : un agent fonctionne parfaitement en démo, convainc les parties prenantes lors des tests, puis échoue en production face à de vrais utilisateurs. Les symptômes sont prévisibles, mauvais appels d'outils, réponses incohérentes, comportements imprévus, mais leur détection systématique exige une infrastructure que la plupart des équipes n'ont pas. AgentCore Evaluations propose un cycle continu : construction de cas de tests, exécution sur l'agent, notation automatisée, analyse des échecs et amélioration itérative. Chaque échec devient automatiquement un nouveau cas de test, ce qui permet de fermer progressivement l'écart entre le comportement attendu et le comportement réel. L'enjeu est structurel : les grands modèles de langage sont non-déterministes. Une même requête peut produire des sélections d'outils différentes, des raisonnements distincts et des réponses variées d'un run à l'autre. Un seul passage de test ne dit pas ce qui se passe habituellement, il dit seulement ce qui peut arriver. Pour obtenir une image fiable du comportement d'un agent, il faut répéter chaque scénario plusieurs fois et agréger les résultats. Sans cela, chaque modification de prompt devient un pari : les équipes ignorent si leurs changements améliorent ou dégradent les performances, et brûlent des crédits API sans visibilité réelle. AgentCore Evaluations adresse précisément cette incertitude en fournissant des métriques de qualité sur plusieurs dimensions, exactitude des sélections d'outils, validité des paramètres, précision des réponses finales, pour le développement comme pour la production. Ce lancement s'inscrit dans une tendance plus large : la maturité des agents d'IA dépasse désormais la phase d'expérimentation et entre dans celle de l'ingénierie de fiabilité. Construire l'infrastructure d'évaluation en interne, curation de datasets, hébergement de modèles de scoring, gestion des limites de débit, pipelines de transformation des traces, tableaux de bord, représente un coût fixe considérable que les équipes multiplient pour chaque agent déployé. Amazon positionne AgentCore Evaluations comme la réponse cloud à ce problème, en absorbant cette complexité dans un service managé. La concurrence est vive : des outils comme LangSmith, Braintrust ou PromptFoo couvrent des besoins similaires, mais l'intégration native dans l'écosystème Bedrock donne à AWS un avantage naturel pour les entreprises déjà engagées sur sa plateforme. La prochaine étape logique sera de voir si le service s'étend aux agents multi-modaux et aux architectures multi-agents, deux domaines où l'évaluation reste un problème ouvert.

UELes équipes européennes développant des agents IA sur Amazon Bedrock peuvent adopter ce service managé pour remplacer une infrastructure d'évaluation coûteuse à construire en interne.

OutilsOutil
1 source
Des agents IA en production pour la conformite financiere : les lecons de Stripe
2AWS ML Blog 

Des agents IA en production pour la conformite financiere : les lecons de Stripe

Stripe, le géant américain des paiements en ligne, a déployé en production un système d'agents IA dédié à la conformité financière, développé sur Amazon Web Services avec Amazon Bedrock. L'entreprise traite 1 400 milliards de dollars de volume de paiements annuels dans 50 pays, en servant des millions d'entreprises allant des startups aux 62 % des sociétés du Fortune 500. Pour gérer les risques de fraude et respecter les obligations réglementaires à cette échelle, ses équipes de conformité devaient examiner des milliers de transactions chaque jour. Le système d'agents, conçu selon un cadre ReAct, a permis de réduire de 26 % le temps de traitement des dossiers, tout en obtenant un taux de satisfaction de 96 % auprès des analystes internes. Les décisions finales restent systématiquement entre les mains d'experts humains. Ce déploiement illustre un problème structurel que rencontrent toutes les grandes institutions financières : les analystes qualifiés passaient jusqu'à 80 % de leur temps à naviguer entre des systèmes fragmentés pour rassembler des documents, au lieu de réaliser des évaluations de risque à haute valeur ajoutée. L'agent IA automatise cette phase de pré-investigation et d'agrégation documentaire, libérant les équipes pour les jugements complexes. À l'échelle mondiale, le coût de la conformité financière est estimé à 206 milliards de dollars par an. L'approche de Stripe permettrait d'identifier 95 % des attaques par test de carte en temps réel et de réduire de 20 % les frictions inutiles pour les clients légitimes, tout en conservant la traçabilité intégrale exigée par les régulateurs grâce à des journaux d'audit immuables. La croissance rapide de Stripe, qui représente aujourd'hui environ 1,3 % du PIB mondial numérique, a rendu intenable une mise à l'échelle des équipes de conformité proportionnelle au volume de transactions. L'entreprise a opté pour une architecture en trois composantes : décomposition des tâches et orchestration des révisions, cadre d'agents ReAct, et services d'infrastructure dédiés. Une attention particulière a été portée à l'optimisation des coûts via le prompt caching et à la gouvernance, avec des workflows d'approbation configurables et des points de contrôle humains à chaque étape critique. Ce modèle, co-développé par les équipes de Stripe et d'AWS, est présenté comme une référence pour les organisations souhaitant industrialiser la conformité sans sacrifier la qualité ni l'auditabilité, dans un contexte où les régulateurs financiers du monde entier renforcent leurs exigences en matière de traçabilité des décisions assistées par IA.

UELes établissements financiers européens soumis aux obligations KYC/AML et aux futures exigences de traçabilité de l'AI Act peuvent s'appuyer sur ce retour d'expérience pour évaluer l'automatisation de leur conformité via des agents IA.

OutilsOutil
1 source
Claude Voice passe enfin de la conversation aux vraies actions
3Le Big Data 

Claude Voice passe enfin de la conversation aux vraies actions

Claude Voice, l'assistant vocal d'Anthropic, s'étend désormais aux modèles Opus et Sonnet, alors qu'il ne reposait jusqu'ici que sur Haiku, la version la plus légère du catalogue. L'annonce a été faite le 23 juillet 2026 via le compte Twitter officiel de Claude, et la bêta est disponible sur toutes les plateformes, sans être réservée aux abonnés payants. Surtout, Claude Voice sort enfin du simple échange oral pour agir concrètement dans des applications tierces : Gmail, Google Calendar, Slack, Canva et Notion figurent parmi les outils déjà connectés. Une commande vocale permet ainsi de déplacer un rendez-vous, rédiger un courriel ou créer un document Notion directement pendant la conversation. Le service reconnaît plusieurs langues, mais l'utilisateur doit la préciser manuellement à chaque échange : anglais, français, allemand, hindi, indonésien, italien, japonais, coréen, portugais du Brésil, ainsi que deux variantes d'espagnol pour l'Amérique latine et l'Espagne. Les comptes gratuits restent toutefois cantonnés à Haiku et limités à une seule application externe connectée à la fois. Cette évolution change concrètement l'usage de l'assistant vocal, qui devient capable de gérer de vraies tâches plutôt que de simplement reformuler une demande. Avec Opus et Sonnet, Anthropic promet des conversations plus longues sur des sujets exigeants, ainsi que des retours sur le style de communication, utiles par exemple pour préparer une présentation ou répéter un argumentaire commercial avant un rendez-vous. Les utilisateurs peuvent aussi réfléchir à voix haute pour construire une étude de marché complète. Cette capacité à déclencher des actions dans des outils du quotidien marque une différence nette avec le mode vocal d'OpenAI, qui reste cantonné à la conversation sans pouvoir agir dans des applications connectées. Lancé l'année dernière avec le seul modèle Haiku, Claude Voice séduisait par sa rapidité mais montrait vite ses limites sur les tâches complexes, selon TechCrunch. Anthropic a donc choisi de faire reprendre automatiquement à l'assistant vocal le dernier modèle utilisé par l'utilisateur dans ses échanges écrits, tout en privilégiant la variante la plus rapide de ce modèle pour éviter des temps de réponse trop longs. L'entreprise précise n'avoir apporté aucun changement au modèle vocal lui-même : l'amélioration porte uniquement sur le raisonnement mobilisé et les actions désormais accessibles. L'architecture technique du système vocal reste pour sa part non divulguée.

OutilsOutil
1 source
Les conséquences imprévues du retour de Codex
4The Information AI 

Les conséquences imprévues du retour de Codex

Le retour de Codex, l'agent de codage d'OpenAI, provoque des effets inattendus au sein même de l'entreprise. Repositionné comme outil polyvalent pour les travailleurs de la connaissance, Codex connaît un regain d'intérêt notable depuis plusieurs semaines, comme l'a souligné mardi Denise Dresser, directrice des revenus d'OpenAI. De nombreux développeurs migrent depuis Claude Code d'Anthropic vers Codex, qu'OpenAI a rendu plus performant sur des tâches longues et complexes. Mais c'est en interne que l'impact se mesure le plus : les ingénieurs d'OpenAI sont passés de deux ou trois modifications de code par jour à plus de dix, selon deux personnes proches du dossier. Cette explosion de productivité a rapidement saturé les systèmes internes gérant la vaste base de code de l'entreprise, provoquant des pannes. Chaque modification déclenche en effet des milliers d'heures de tests automatisés exécutés en parallèle sur de nombreuses machines, destinés à vérifier que le code fonctionne correctement et ne contient ni bug ni faille de sécurité. Multiplier par cinq le volume quotidien de commits a surchargé une infrastructure de validation qui n'était pas dimensionnée pour absorber ce rythme. C'est un paradoxe révélateur : l'outil censé accélérer le développement finit par bloquer la livraison. Cet épisode illustre un défi structurel que l'ensemble de l'industrie tech va devoir affronter à mesure que les agents de codage s'imposent dans les workflows professionnels. Les pipelines CI/CD, les systèmes de revue de code et les infrastructures de test ont été conçus pour un rythme humain. Avec des agents capables de multiplier la cadence de production, c'est toute la chaîne d'intégration qui devient un goulot d'étranglement. OpenAI se retrouve ainsi en première ligne d'un problème d'échelle que ses propres outils ont créé, et dont la résolution conditionnera l'adoption large des agents autonomes dans les grandes organisations.

OutilsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic