Aller au contenu principal
OutilsMarkTechPost · 3 min de lecture

Supabase lance Evals, un benchmark open source qui évalue Claude Code, Codex et OpenCode sur des tâches Supabase réelles

Source originale ↗·

Supabase a mis en open source, sous licence Apache-2.0, son propre outil d'évaluation baptisé Supabase Evals, un cadre de test qui mesure la capacité des agents de codage IA à construire des applications avec Supabase. Le framework fait tourner des agents comme Claude Code, Codex et OpenCode sur des tâches réelles : créer un schéma de base de données, déboguer une Edge Function défaillante ou corriger une politique RLS (row level security) cassée. Les résultats alimentent un classement public sur supabase.com/evals ainsi qu'une suite de régression interne surveillée quotidiennement. Le dépôt supabase/evals est disponible dès maintenant et s'exécute en local via pnpm, à condition de disposer d'un démon Docker, de clés API des fournisseurs de modèles et de ports libres entre 54321 et 54329. L'équipe a structuré ses scénarios autour de trois axes : les produits concernés (base de données, authentification, stockage, Edge Functions, temps réel, tâches planifiées, files d'attente, vecteurs, API de données), les sujets techniques (RLS, sécurité, migrations, SQL, SDK, observabilité, auto-hébergement, tests, schéma déclaratif) et les étapes du travail (construction, déploiement, investigation, résolution). Chaque scénario, tiré de tickets de support, de rapports de bugs ou d'issues GitHub réels, tourne dans un environnement complet, une pile proche de l'hébergement Supabase et un projet CLI local dans des conteneurs, où les agents appellent le véritable serveur MCP et la CLI réelle. La notation combine des vérifications déterministes et un jugement par un autre modèle, avec un seul essai de rattrapage autorisé avant la note finale.

Cet outil répond à un besoin concret pour les équipes qui déploient des agents IA en production : vérifier qu'un agent ne casse rien avant de le laisser toucher à une base de données réelle. Dans les secteurs régulés comme la fintech ou la santé, une politique RLS mal écrite par un agent n'est pas un simple bug, c'est un incident de sécurité susceptible d'exposer des données sensibles. En publiant un classement comparatif entre agents, Supabase donne aux équipes techniques un moyen objectif de choisir quel harnais d'agent utiliser, tout en se dotant d'un outil interne pour tester ses propres changements de documentation ou de compétences avant de publier une nouvelle version de son SDK. Les scénarios de régression, renouvelés chaque jour sans affecter les scores publics, permettent de détecter rapidement si une évolution du produit ou de la documentation dégrade les performances des agents, un usage central à mesure que le développement assisté par IA se généralise dans les équipes produit.

Ce lancement illustre une tendance plus large : les fournisseurs d'infrastructure cherchent désormais à démontrer, plutôt qu'à simplement promettre, la fiabilité des agents IA sur leurs plateformes. Le billet de lancement de Supabase, publié le 31 juillet 2026, détaille déjà des résultats révélant que Codex, propulsé par GPT-5.6, consulte en moyenne huit pages de documentation par scénario contre seulement deux pour Claude Code, ce dernier ne vérifiant la documentation que dans moins de 40% des scénarios même quand les compétences Supabase sont chargées. Autre enseignement notable, une simple réécriture de la description de la compétence sur les bonnes pratiques Postgres a fait passer son taux d'activation d'environ une session sur dix à 60%, preuve que la formulation des instructions données aux agents pèse autant que leurs capacités brutes. Ces chiffres, encore provisoires, sont amenés à évoluer à mesure que les modèles progressent, et Supabase invite à consulter la page en direct plutôt que ces résultats figés. Le projet reste disponible sur GitHub sous licence Apache-2.0, ouvrant la voie à des contributions externes pour étendre la couverture des scénarios testés.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

MiMo Code de Xiaomi, outil de codage IA open source, surpasse Claude Code sur les tâches de plus de 200 étapes
1VentureBeat AI 

MiMo Code de Xiaomi, outil de codage IA open source, surpasse Claude Code sur les tâches de plus de 200 étapes

Xiaomi a publié le 10 juin 2026 MiMo Code V0.1.0, un assistant de programmation propulsé par IA qui fonctionne directement dans le terminal. L'équipe MiMo de la marque chinoise affirme que cet outil surpasse Claude Code d'Anthropic sur les tâches longues et complexes, notamment celles dépassant 200 étapes successives. Selon des benchmarks publiés dans leur blog technique, MiMo Code couplé au modèle MiMo-V2.5-Pro obtient 82 % sur SWE-bench Verified contre 79 % pour Claude Code avec Claude Sonnet 4.6, 62 % contre 55 % sur SWE-bench Pro, et 73 % contre 69 % sur Terminal Bench 2. L'outil est disponible sur GitHub sous licence MIT, s'installe en une seule commande sur macOS et Linux, et inclut un accès gratuit limité au modèle multimodal MiMo-V2.5, doté d'une fenêtre de contexte d'un million de tokens sans inscription requise. Le projet est un fork d'OpenCode, enrichi par Xiaomi d'une architecture mémoire propriétaire. Ce qui distingue MiMo Code de ses concurrents, c'est précisément sa réponse à un problème bien connu des développeurs utilisant des agents IA sur de longues sessions : la dégradation progressive des performances à mesure que la fenêtre de contexte se remplit. Xiaomi a conçu un système de mémoire persistante à quatre couches, alimenté par SQLite FTS5, couvrant la mémoire projet (un fichier MEMORY.md permanent), des points de contrôle de session, des notes temporaires et des journaux de progression par tâche. L'originalité du système réside dans le déploiement d'un sous-agent indépendant, le "checkpoint-writer", qui prend des notes en temps réel sans interrompre l'agent principal. Deux mécanismes complètent l'ensemble : une commande /dream qui, toutes les sept jours environ, consolide les sessions passées en mémoire long terme, et une fonction "distill" qui identifie les flux de travail répétitifs pour les automatiser. L'arrivée de MiMo Code s'inscrit dans une course mondiale au meilleur agent de programmation, où Anthropic, OpenAI et Google se disputent la première place. Xiaomi, encore peu présent dans l'écosystème des outils développeurs en Occident, tente ici une percée directe sur un segment stratégique. L'approche open source sous licence MIT et l'accès gratuit au modèle sont clairement conçus pour attirer rapidement une base d'utilisateurs et générer des retours terrain. Les chiffres avancés s'appuient toutefois sur une étude interne portant sur 576 développeurs, ce qui appelle une certaine prudence avant validation indépendante. Xiaomi n'a pas publié de comparaisons face à Codex d'OpenAI ni aux outils de Google, deux absences notables qui limitent la portée de ces résultats. La vraie question est désormais de savoir si la communauté open source s'appropriera l'outil et si les performances annoncées résisteront à des audits externes.

UELes développeurs français et européens peuvent installer et tester gratuitement cet agent de codage open source sous licence MIT, sans impact réglementaire ou institutionnel direct pour la France ou l'UE.

OutilsOutil
1 source
Databricks publie Omnigent en open source : un orchestrateur d'agents IA qui unifie Claude Code, Codex et Pi
2MarkTechPost 

Databricks publie Omnigent en open source : un orchestrateur d'agents IA qui unifie Claude Code, Codex et Pi

Databricks a publié Omnigent, un "meta-harness" open source placé au-dessus des agents IA existants comme Claude Code, Codex et Pi. Développé en collaboration avec Neon et distribué sous licence Apache 2.0, Omnigent ne remplace pas ces outils : il s'installe une couche au-dessus d'eux pour les orchestrer comme des pièces interchangeables d'un même système. Concrètement, un "harness" est l'enveloppe logicielle qui transforme un modèle de langage en agent capable d'agir. Omnigent standardise l'interface de ces harnesses, messages entrants, fichiers, flux de texte et appels d'outils sortants, pour qu'ils deviennent substituables sans réécriture de code. L'outil s'installe via deux alias CLI identiques, omnigent et omni, et lance au démarrage une interface web locale sur localhost:6767, synchronisée en temps réel avec le terminal et accessible depuis un téléphone. Pour les équipes d'ingénieurs qui jonglent déjà entre quatre ou cinq agents simultanément en copiant du texte entre des outils de code, des moteurs de recherche et Slack, Omnigent apporte trois capacités structurantes. La composition permet de combiner modèles et harnesses sans toucher au code : un simple changement d'une ligne suffit à basculer de Claude Code à Codex. Le contrôle introduit des politiques stateful, par exemple, mettre un agent en pause après chaque dépense de 100 dollars, ou exiger une validation humaine avant un git push si l'agent a installé un nouveau paquet npm. La collaboration permet de partager une session d'agent en direct par URL : les coéquipiers peuvent observer, commenter des fichiers, co-piloter ou bifurquer la conversation. Un sandbox système appelé Omnibox assure la sécurité sous-jacente, notamment en injectant les tokens GitHub uniquement via un proxy de sortie approuvé, sans les exposer à l'agent. Le projet embarque deux agents d'exemple révélateurs de la philosophie de l'outil. "Polly" est un orchestrateur multi-agents qui ne génère aucun code lui-même : il planifie, puis délègue en parallèle à des sous-agents dans des worktrees git distincts, avec une revue croisée assurée par un agent d'un fournisseur différent de celui qui a écrit le code. "Debby" est un partenaire de brainstorming à deux têtes, Claude et GPT, qui répond en parallèle à chaque question et peut déclencher un débat contradictoire entre les deux via la commande /debate. Ces exemples illustrent une tendance de fond : avec la multiplication des agents spécialisés, la compétition ne se joue plus seulement au niveau du modèle, mais à celui de l'orchestration. Omnigent positionne Databricks sur ce terrain en proposant une couche de gouvernance neutre, ouverte, et potentiellement universelle pour l'écosystème des agents de développement.

💬 Le truc qui m'a accroché, c'est pas la couche d'orchestration générique, c'est les politiques de contrôle : mettre un agent en pause après 100 dollars de dépenses, bloquer un git push si un nouveau paquet npm s'est glissé sans validation humaine, c'est le maillon qui manquait depuis qu'on jongle avec cinq agents en même temps. Databricks parie que la bataille se joue à la gouvernance plutôt qu'au modèle, et ce pari-là je le trouve solide. Apache 2.0, Neon dans la boucle, reste à voir si l'écosystème suit vraiment.

OutilsOutil
1 source
WebBrain : un agent de navigation IA open-source et local qui lit les pages et automatise des tâches sur Chrome et Firefox
3MarkTechPost 

WebBrain : un agent de navigation IA open-source et local qui lit les pages et automatise des tâches sur Chrome et Firefox

WebBrain est un agent de navigation open source, gratuit et disponible pour Chrome et Firefox, développé par Emre Sokullu sous licence MIT, avec son code source publié sur GitHub. L'extension s'installe dans le panneau latéral du navigateur, en Manifest V3 avec l'API sidePanel sur Chrome et en Manifest V2 avec sidebar_action sur Firefox, et chaque onglet conserve son propre historique de conversation. Elle propose deux modes : le mode Ask, en lecture seule, qui analyse les pages via des scripts de contenu classiques, et le mode Act, capable de cliquer, taper, faire défiler et naviguer, en pilotant la page via le protocole Chrome DevTools et l'API chrome.debugger, ce qui permet de générer des événements reconnus comme fiables par les sites modernes et d'atteindre les iframes cross-origin et le shadow DOM. Les températures sont fixées pour plus de prévisibilité : 0,15 en mode Act, 0,3 en mode Ask et 0 pour les descriptions de captures d'écran. L'outil est disponible en anglais, espagnol, français, turc et chinois, détecte automatiquement la langue du navigateur, ne collecte aucune donnée externe et n'intègre ni télémétrie ni compte utilisateur. Point clé : en connectant WebBrain à un modèle local, aucune donnée de page ne quitte la machine de l'utilisateur, une option rare parmi les agents de navigation IA. Cette approche locale-first change la donne pour la confidentialité des données dans un secteur où la plupart des agents IA de navigateur transitent systématiquement par des API cloud. Les utilisateurs professionnels manipulant des informations sensibles, comptes bancaires, dossiers clients ou données internes d'entreprise, peuvent ainsi automatiser des tâches répétitives comme l'extraction de données depuis des catalogues, le remplissage de formulaires ou le résumé d'articles, sans exposer ces informations à un tiers. WebBrain a aussi été pensé pour limiter les coûts en tokens sur les sessions longues : les captures d'écran sont redimensionnées et compressées en JPEG avant traitement, et l'historique de conversation est tronqué en commençant par les éléments les plus anciens lorsque la fenêtre de contexte se remplit. Il est également possible d'associer un modèle texte économique pour la planification à un modèle de vision distinct pour l'analyse des captures d'écran, une flexibilité qui réduit encore la facture pour les utilisateurs de modèles cloud. Le développement de WebBrain répond à un problème de sécurité identifié dans les agents de navigation : les pages web peuvent dissimuler des injections de prompt destinées à détourner le comportement de l'agent. Face à ce risque, l'outil démarre toujours en mode Ask en lecture seule, demande une confirmation avant toute action jugée conséquente (ces alertes pouvant être désactivées dans les paramètres) et impose une règle stricte pour toute mutation de données : créer, envoyer, soumettre ou acheter passe obligatoirement par l'interface visible du site plutôt que par des appels directs aux API REST ou GraphQL, sauf dérogation ponctuelle via la commande /allow-api en cas d'échec de l'interface. La lecture de contenu, elle, bénéficie de règles plus souples via les outils fetchurl et researchurl puisqu'elle ne modifie rien à distance. WebBrain se positionne ainsi entre les simples extensions IA de navigateur et les frameworks d'agents complets, dans un marché où la question de la confiance et du contrôle utilisateur devient centrale à mesure que ces outils gagnent en autonomie sur des tâches concrètes comme la recherche, le remplissage de formulaires ou l'automatisation multi-étapes.

💬 Reste à voir si ça tient en prod, mais l'idée de base est bonne : un agent qui pilote ton navigateur sans faire transiter tes pages par un cloud tiers, c'est ce que devrait être le standard depuis le début. Là où la plupart des agents web envoient tes onglets bancaires ou tes CRM à une API distante, celui-là tourne en local si tu le branches sur ton propre modèle, ce qui change complètement le calcul risque/bénéfice pour les pros. Le vrai signal du marché, c'est que le contrôle utilisateur (mode lecture par défaut, confirmation avant chaque action, interface visible obligatoire plutôt qu'appels API directs) devient un argument de vente à part entière, pas une case à cocher pour les juristes.

OutilsOutil
1 source
OpenAI lance ChatGPT Work, un agent IA cloud qui gère les tâches sur email, Slack et calendriers
4VentureBeat AI 

OpenAI lance ChatGPT Work, un agent IA cloud qui gère les tâches sur email, Slack et calendriers

OpenAI a lancé jeudi ChatGPT Work, un nouvel agent intégré à son chatbot phare, alimenté par son dernier modèle, GPT-5.6. L'outil vise à transformer ChatGPT d'un simple outil de questions-réponses en une plateforme de travail autonome capable d'exécuter des tâches complexes et multi-étapes directement dans les e-mails, calendriers, dépôts de code et messageries des utilisateurs. Ty Geri, chef de produit chez OpenAI ayant contribué au développement de ChatGPT Work, a expliqué que l'agent puise le contexte dans les applications, fichiers et flux de travail connectés pour produire des documents, tableurs, présentations, rapports et sites web finalisés. À partir d'un objectif donné, il découpe la tâche en étapes et peut travailler seul pendant des heures sur des projets complexes. Le déploiement commence avec les abonnés Pro, Enterprise et Edu, avant de s'étendre dans les prochains jours aux utilisateurs Plus et Business. Le cœur technique du produit repose sur une machine virtuelle persistante hébergée dans le cloud d'OpenAI, accessible en permanence depuis n'importe quel appareil, y compris sur mobile. Cette annonce marque la tentative la plus nette d'OpenAI de repositionner ChatGPT comme plateforme professionnelle plutôt que comme simple agent conversationnel. Selon Geri, l'objectif est de démocratiser les capacités agentiques déjà démontrées en interne par Codex, l'outil d'ingénierie d'OpenAI, dont l'adoption suit une courbe exponentielle dans toutes les fonctions de l'entreprise. Fait notable, cette technologie n'est pas réservée aux abonnements les plus chers : elle est disponible dès l'offre Plus, ce que Geri présente comme une prouesse conforme à la mission d'OpenAI de rendre cette puissance accessible au plus grand nombre. L'approche mobile constitue aussi une nouveauté sur le marché, avec la possibilité de créer un site web depuis son téléphone et de le partager instantanément avec des collaborateurs. Sur le plan technique, ChatGPT Work s'appuie sur des plugins basés sur le protocole MCP (Model Context Protocol) pour se connecter à Gmail, Google Calendar, Slack et GitHub, et la prise en charge de plusieurs comptes Gmail simultanés figure déjà sur la feuille de route. Ce lancement intervient à un moment charnière pour OpenAI, qui a déposé le mois dernier un dossier confidentiel d'introduction en bourse auprès de la SEC, avec une valorisation estimée entre 730 et 852 milliards de dollars et un chiffre d'affaires annualisé dépassant désormais les 25 milliards de dollars. Face à des concurrents dont les agents dépendent d'une machine locale allumée et connectée, OpenAI mise sur une infrastructure cloud toujours disponible pour asseoir son avance dans la course à l'IA agentique en entreprise.

💬 OpenAI ne lance pas juste une feature, il déplace ChatGPT du chat vers l'agent qui bosse tout seul pendant des heures dans ta boîte mail et ton Slack. Ce qui change vraiment, c'est le prix : cette capacité arrive dès l'abonnement Plus, pas réservée aux comptes Enterprise, et ça c'est une vraie rupture de stratégie face à Google ou Microsoft qui verrouillent ce genre d'outil derrière des licences pro. Reste à voir si une VM cloud "toujours allumée" tient ses promesses sur des tâches multi-étapes réelles, parce que sur le papier c'est bluffant, mais l'agentique a déjà déçu plus d'une fois en prod.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic