Aller au contenu principal
AI Evals : Intelligence prouve que le « goût » et le RLHF créatif remplacent les benchmarks automatisés
BusinessLe Big Data · 3 min de lecture

AI Evals : Intelligence prouve que le « goût » et le RLHF créatif remplacent les benchmarks automatisés

Source originale ↗·

La startup Intelligence, éditrice de la plateforme Design Arena, a bouclé le 3 août 2026 une levée de fonds d'amorçage de 7,9 millions de dollars, menée par Index Ventures avec la participation de Valkyrie, de Conviction (portée par Sarah Guo et Mike Vernal) et de A*. Fondée en 2025 par Grace Li et Kamryn Ohly, l'entreprise est née d'un constat simple : les algorithmes actuels peinent à concevoir des interfaces ou des jeux réellement plaisants à utiliser. En six mois, avec une équipe de dix personnes seulement, Intelligence affirme être passée de 5 à 60 millions de dollars de revenus annuels récurrents (ARR), tout en rassemblant 5,5 millions d'utilisateurs dans plus de 190 pays, selon les chiffres communiqués par Grace Li sur X. Ce succès repose sur Design Arena, un outil qui fait évaluer par des humains, via des comparaisons A/B à l'aveugle, des rendus visuels et des maquettes web générés par différents modèles d'IA, sans révéler lequel les a produits. Les votes alimentent un classement dynamique basé sur le système Elo, la même logique que celle popularisée par les tests d'aveugle documentés sur le blog de LMSYS Org pour comparer les chatbots.

Cette approche répond à une impasse que rencontrent aujourd'hui les laboratoires de Machine Learning : les métriques automatisées classiques, comme la perplexité pour le texte ou les scores FID et CLIP pour l'image, atteignent un plafond de verre qualitatif. Le score CLIP, par exemple, mesure la cohérence sémantique entre un texte et une image, mais reste incapable de juger la finesse d'une interface utilisateur, son ergonomie ou son attrait émotionnel. Des équipes entières peuvent ainsi produire des modèles techniquement conformes aux benchmarks, sans parvenir à générer des produits réellement désirables sur le marché. Le Hugging Face Blog a lui-même souligné que les classements statiques fondés sur des métriques automatisées sont particulièrement vulnérables à la manipulation et au surentraînement. En transformant le jugement esthétique subjectif de millions d'utilisateurs en données quantifiables, Intelligence offre aux directeurs des données et aux équipes produit un signal fiable pour orienter le développement de leurs modèles visuels et applicatifs. Pour les grands laboratoires d'IA, payer pour accéder à ce goût collectif devient une nécessité stratégique autant qu'un argument commercial.

L'intégration du feedback humain dans l'entraînement des modèles n'est pas une nouveauté : l'apprentissage par renforcement à partir des préférences humaines (RLHF) a servi de fondation à l'alignement des grands modèles de langage, comme le documentent depuis plusieurs années les publications de recherche d'OpenAI. Ce qui change avec Intelligence, c'est l'extension de ce principe au design visuel et à l'expérience produit, un champ que l'écosystème commence à désigner sous le terme de RLHF créatif. Cette évolution intéresse directement les Frontier Labs, ces laboratoires qui développent les modèles d'IA les plus avancés, mais aussi les éditeurs de logiciels d'entreprise, confrontés à la nécessité d'aligner leurs outils génératifs sur des standards de qualité visuelle et ergonomique, et non plus seulement sur des critères mathématiques abstraits. À mesure que la génération d'interfaces, de sites web ou d'applications par l'IA se banalise, la capacité à mesurer objectivement ce qui plaît réellement aux utilisateurs devient un avantage concurrentiel décisif. Reste à savoir si ce modèle de goût industrialisé tiendra face à la diversité culturelle des usages, et si d'autres acteurs tenteront de répliquer la formule d'Intelligence pour capter une part de ce marché naissant de l'évaluation humaine à grande échelle.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Prime Intellect : pourquoi les entreprises créent leurs propres agents IA plutôt que d’utiliser ChatGPT ?
1Le Big Data 

Prime Intellect : pourquoi les entreprises créent leurs propres agents IA plutôt que d’utiliser ChatGPT ?

Prime Intellect, une startup américaine fondée en 2024, vient de lever 130 millions de dollars lors d'un tour de série A mené par Radical Ventures, portant sa valorisation à un milliard de dollars. Parmi les investisseurs figurent également Nvidia, Intel Capital, Dell, ainsi qu'une liste de business angels issus de Perplexity, Box, Harvey, Cognition ou encore Zapier. Contrairement à OpenAI ou Anthropic, l'entreprise ne cherche pas à développer un nouveau grand modèle de langage généraliste. Son ambition, selon son cofondateur Vincent Weisser, est de fournir aux entreprises l'infrastructure technique complète pour entraîner et adapter leurs propres agents d'intelligence artificielle, sans dépendre exclusivement des grands laboratoires qui concentrent aujourd'hui les capacités de développement des modèles les plus avancés. Cette levée de fonds illustre un basculement dans la manière dont les entreprises abordent l'IA générative. Après avoir massivement adopté des outils prêts à l'emploi comme ChatGPT pour automatiser certaines tâches, de nombreuses organisations se heurtent désormais aux limites de ces solutions en contexte professionnel. Les données sensibles, les procédures internes et les informations stratégiques sont de plus en plus difficiles à confier à des modèles propriétaires hébergés par des fournisseurs tiers. S'ajoute à cela la crainte d'une dépendance excessive à des plateformes dont les tarifs, les modèles ou les conditions d'accès aux API peuvent évoluer sans préavis, une inquiétude renforcée par plusieurs changements de stratégie récents et l'abandon de projets expérimentaux chez certains grands acteurs du secteur. Pour les directions informatiques, la promesse de Prime Intellect consiste précisément à reprendre la main sur les données et sur l'infrastructure, plutôt que de rester locataires d'un service externe. Cette approche répond à un besoin de différenciation concurrentielle. Un agent IA générique répond à des questions générales à partir de ses connaissances et des données fournies ponctuellement par l'utilisateur, tandis qu'un agent construit sur une infrastructure comme celle de Prime Intellect peut être connecté directement aux bases documentaires, aux feuilles de calcul et aux applications métiers d'une entreprise, avec un entraînement et un apprentissage par renforcement adaptés à son activité précise. La personnalisation devient alors un avantage difficile à répliquer, puisqu'elle repose sur des données propriétaires inaccessibles aux modèles généralistes. Cette tendance, déjà observée chez des startups spécialisées comme Harvey dans le juridique, s'inscrit dans un mouvement plus large de désintermédiation vis-à-vis des grands laboratoires d'IA, où les entreprises cherchent à sécuriser leur autonomie technologique tout en tirant parti des avancées des modèles ouverts et modulaires.

💬 Prime Intellect illustre un truc que je vois venir depuis un moment : les boîtes en ont marre de louer leur intelligence à OpenAI ou Anthropic, elles veulent la posséder. Un milliard de valorisation pour vendre de l'infra plutôt qu'un modèle, ça montre que le vrai avantage compétitif en 2026 c'est plus le LLM générique, c'est ce que tu branches dessus (tes docs, ton CRM, ton métier). Reste à voir si les boîtes qui se lancent là-dedans ont vraiment les équipes pour gérer ça, parce que l'infra IA maison, c'est un métier à part entière.

BusinessOpinion
1 source
L’ère du GEO : repenser la visibilité à l’aune de l’Intelligence Artificielle
2Le Big Data 

L’ère du GEO : repenser la visibilité à l’aune de l’Intelligence Artificielle

Le référencement traditionnel connaît une mutation profonde avec l'émergence du GEO (optimisation pour les moteurs génératifs), une discipline qui vise désormais à rendre les marques visibles non plus sur Google mais dans les réponses générées par les intelligences artificielles comme ChatGPT, Gemini ou Perplexity. Rahma Vialette, consultante SEO expérimentée, documente cette transition dans un article qui détaille les nouvelles pratiques du secteur. Selon elle, l'objectif n'est plus d'être premier sur un moteur de recherche classique, mais de devenir la source que les IA choisissent de citer lorsqu'elles répondent aux utilisateurs. Cette bascule s'appuie sur plusieurs leviers concrets : la production de contenus experts appuyés sur des preuves (témoignages, études), une cohérence éditoriale sans faille, des citations obtenues sur des domaines à forte autorité, ainsi qu'une structuration technique des données via le JSON-LD avancé et le « chunking » sémantique, qui découpe l'information en blocs directement exploitables par les robots d'indexation des IA. Cette évolution redéfinit en profondeur les métriques de succès du marketing numérique. Le clic, longtemps unité de mesure reine du SEO, perd sa centralité face à la montée des « moteurs de réponse » qui synthétisent l'information directement à la source, sans renvoyer l'utilisateur vers le site d'origine. Les professionnels doivent désormais suivre des indicateurs plus qualitatifs, comme la qualité des visites générées ou le taux de conversion, au détriment du volume brut de trafic. Pour les marques, l'enjeu devient existentiel : ne pas être citée par les IA génératives revient à disparaître du parcours d'achat ou de décision des utilisateurs, qui interrogent de plus en plus directement ces assistants plutôt que de naviguer sur des pages web classiques. Cela impose une refonte des stratégies de contenu, pensées non plus pour un classement dans une liste de résultats, mais pour être comprises, extraites et reformulées fidèlement par des algorithmes. Ce basculement s'inscrit dans un mouvement de fond où les IA génératives captent une part croissante des usages autrefois dévolus aux moteurs de recherche traditionnels. Rahma Vialette souligne que la confiance est le carburant de ces systèmes : la récurrence d'une marque dans des sources jugées fiables conditionne sa présence dans les réponses des IA. À plus long terme, l'article anticipe une ère où des agents IA autonomes prendront eux-mêmes des décisions d'achat pour le compte des utilisateurs, ce qui accentuerait encore la nécessité pour les marques de structurer leur présence numérique en fonction des critères de lecture propres aux machines plutôt qu'à des internautes humains.

BusinessOpinion
1 source
Millennium et Anthropic : l’IA agentique va-t-elle remplacer les analystes de risque juniors ?
3Le Big Data 

Millennium et Anthropic : l’IA agentique va-t-elle remplacer les analystes de risque juniors ?

L'alliance entre le hedge fund Millennium et Anthropic marque une étape décisive dans l'automatisation des métiers de marché. Le secteur financier confie désormais l'évaluation de ses expositions à un agent virtuel autonome, ce qui transforme le rôle de l'analyste de risque et interroge directement l'avenir des profils juniors. Le hedge fund Millennium Management, qui gère plus de 92 milliards de dollars d'actifs, s'est associé à Anthropic pour co-développer un agent d'intelligence artificielle dédié à l'analyse des risques financiers, une collaboration révélée le 6 août 2026. Des ingénieurs d'Anthropic travaillent directement avec les équipes technologiques et de gestion des risques du fonds, au sein du laboratoire d'IA interne récemment lancé par Millennium. Bâti sur les modèles de la famille Claude, cet agent conserve la mémoire des interactions passées, exécute ses tâches dans des environnements isolés et sécurisés, fournit des explications détaillées sur les variations quotidiennes du risque, et ingère en continu de grands volumes de données propriétaires pour détecter des anomalies sur l'ensemble des classes d'actifs. Le déploiement doit toucher plus de 340 équipes d'investissement au sein du fonds. Selon Bloomberg, qui a détaillé le projet, la maîtrise des limites de risque et de l'effet de levier demeure au cœur de l'activité des fonds alternatifs, ce qui explique pourquoi chaque recommandation générée par l'outil doit être validée par des experts humains formés à cette supervision. Ce partenariat dépasse le simple gain de productivité : il redessine l'architecture des métiers du risk management dans la finance. Les tâches d'agrégation de données, de nettoyage de fichiers, de reporting quotidien et de pré-filtrage des alertes, qui constituaient jusqu'ici le cœur du travail des analystes juniors, sont progressivement automatisées, déplaçant le rôle humain vers le contrôle, la validation et la décision stratégique. Millennium affirme vouloir accélérer l'analyse des positions tout en maintenant le jugement humain au centre de la gouvernance, mais cette évolution modifie déjà les critères de recrutement des institutions financières, la demande se réorientant vers des profils hybrides capables d'auditer des algorithmes, de maîtriser le prompt engineering et de comprendre la modélisation financière complexe. Pour les directions des ressources humaines et informatiques du secteur, la question posée n'est plus seulement celle de l'efficacité opérationnelle, mais celle du devenir des filières de formation et de recrutement des jeunes analystes. Cette alliance s'inscrit dans une stratégie plus large de Millennium, qui a créé un laboratoire d'IA interne pour accélérer l'adoption de modèles avancés sur ses flux opérationnels critiques, dans un secteur où la rapidité de réaction face aux mouvements de marché conditionne directement la rentabilité. Pour Anthropic, ce projet illustre la montée en puissance de son modèle de déploiement dit forward-deployed, où des ingénieurs sont intégrés directement chez le client pour entraîner l'agent sur des portefeuilles réels tout en consignant chaque étape de son raisonnement, dans un souci de traçabilité totale, une approche qui traduit aussi la concurrence croissante entre laboratoires d'IA pour s'implanter dans la finance de marché. D'autres fonds alternatifs et banques d'investissement observent de près cette expérimentation, qui pourrait servir de modèle si elle démontre sa fiabilité sous contrainte réglementaire. Reste à savoir comment les régulateurs encadreront le recours croissant à des agents autonomes dans des fonctions aussi sensibles que la gestion du risque, et si les gains de productivité annoncés se traduiront par des suppressions de postes ou par une simple redéfinition des compétences attendues.

UELes fonds alternatifs et banques europeennes suivront cette experimentation americaine pour evaluer l'adoption d'agents IA dans la gestion des risques financiers, sans qu'aucune entite francaise ou europeenne ne soit impliquee a ce stade.

💬 Millennium confie à un agent Claude les tâches d'agrégation et de pré-filtrage sur 340 équipes d'investissement, mais chaque recommandation reste validée par un humain formé à la supervision, ce n'est pas de l'automatisation totale, c'est un déplacement du travail vers le contrôle. Le vrai signal, c'est que le métier d'analyste junior change de nature avant même de disparaître : on va recruter des gens qui savent auditer un algorithme plutôt que compiler un fichier Excel. Reste à voir comment un régulateur va accepter qu'une décision de risque s'appuie sur le raisonnement d'un modèle, même tracé pas à pas.

BusinessOpinion
1 source
Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence
4Le Big Data 

Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence

Ineffable Intelligence, startup londonienne fondée par David Silver, le chercheur britannique à l'origine d'AlphaGo, a annoncé lors du Google Cloud Summit London 2026 un partenariat stratégique avec Google Cloud pour soutenir le développement de son projet de superintelligence. Cette alliance intervient dans la foulée d'une levée de fonds de 1,1 milliard de dollars, la plus importante jamais réalisée par une startup européenne spécialisée dans l'IA. Concrètement, Ineffable Intelligence déploiera sur l'infrastructure Google Cloud l'un des plus grands clusters A5X au monde, équipé de GPU NVIDIA Vera Rubin NVL72, pour entraîner ce qu'elle appelle un « super-apprenant » : une intelligence artificielle capable d'acquérir des connaissances par l'expérience directe, en continu, plutôt qu'à partir de vastes ensembles de données précompilées. L'enjeu dépasse largement le simple choix d'un prestataire cloud. Les systèmes fondés sur l'apprentissage par renforcement continu imposent des contraintes d'infrastructure radicalement différentes des modèles génératifs classiques : ils génèrent, évaluent et exploitent en temps réel des flux d'expériences, ce qui exige non seulement une puissance de calcul considérable, mais aussi une interconnexion ultra-performante entre GPU, réseau à haut débit et stockage optimisé. Google Cloud se positionne précisément sur cette architecture intégrée, présentée comme un avantage décisif pour les laboratoires les plus exigeants. Pour l'industrie, ce partenariat marque une étape dans la compétition entre hyperscalers pour capter les projets d'IA les plus ambitieux, où l'infrastructure devient un levier de différenciation aussi important que les algorithmes eux-mêmes. David Silver, figure emblématique du domaine depuis sa contribution décisive à AlphaGo chez DeepMind, a quitté Google pour fonder Ineffable Intelligence avec l'ambition explicite de développer des systèmes capables de dépasser les capacités humaines dans des domaines comme les sciences, les mathématiques ou la technologie. L'approche par apprentissage par renforcement qu'il défend s'inscrit dans une tradition de recherche distincte des grandes entreprises qui misent sur la mise à l'échelle de modèles de langage entraînés sur du texte. Le choix de Google Cloud comme partenaire est une décision stratégique pour les deux parties : Ineffable Intelligence bénéficie d'une infrastructure de premier rang à grande échelle, tandis que Google utilise ce partenariat comme vitrine pour démontrer la maturité de son offre IA à une période où la concurrence entre Azure, AWS et Google Cloud pour attirer les laboratoires de recherche de pointe n'a jamais été aussi intense. La levée de 1,1 milliard confirme que le projet est pris très au sérieux par les investisseurs, même si l'horizon d'une superintelligence opérationnelle reste indéfini.

UELa levée record d'1,1 milliard de dollars par Ineffable Intelligence, startup londonienne fondée par le chercheur britannique à l'origine d'AlphaGo, s'impose comme un signal fort pour l'écosystème européen de l'IA, confirmant sa capacité à générer des laboratoires de recherche de niveau mondial capables de rivaliser avec les géants américains.

💬 David Silver quitte Google pour lever 1,1 milliard et retourner entraîner ses modèles sur... l'infra Google. Le serpent qui se mord la queue, mais version superintelligence. Ce qui m'intéresse vraiment là-dedans, c'est l'approche : de l'apprentissage par renforcement continu plutôt que du scaling de LLM sur texte, c'est une vraie bifurcation par rapport à ce que font OpenAI ou Anthropic. Reste à voir si ça donne quelque chose en dehors des jeux de plateau.

BusinessOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic