Aller au contenu principal
Andrej Karpathy : les humains sont désormais le goulot d'étranglement de la recherche en IA face à des résultats faciles à mesurer
RechercheThe Decoder · 1 min de lecture

Andrej Karpathy : les humains sont désormais le goulot d'étranglement de la recherche en IA face à des résultats faciles à mesurer

Source originale ↗·

Andrej Karpathy, l'un des chercheurs les plus influents du domaine de l'intelligence artificielle et cofondateur d'OpenAI, a fait une révélation qui illustre un basculement profond dans la recherche en IA : il a laissé un agent autonome optimiser sa configuration d'entraînement pendant une nuit, et celui-ci a identifié des améliorations qu'il n'avait pas su trouver lui-même, malgré deux décennies d'expérience dans le domaine.

Ce constat dépasse l'anecdote personnelle. Karpathy pointe un phénomène structurel : dans les tâches de recherche où les résultats sont facilement mesurables, optimisation de hyperparamètres, benchmarks standardisés, réglage de pipelines d'entraînement, les agents IA surpassent désormais la capacité humaine d'exploration. Le chercheur suggère que l'humain n'est plus le moteur de ces cycles d'amélioration, mais le goulot d'étranglement qui les ralentit.

L'expérience de Karpathy s'inscrit dans une tendance plus large : les laboratoires de recherche comme OpenAI, Google DeepMind ou Anthropic investissent massivement dans des systèmes capables de s'auto-améliorer sur des métriques précises. Ce que Karpathy décrit de façon concrète, un agent qui travaille en continu, sans fatigue, en explorant un espace de solutions bien plus vaste qu'un humain ne pourrait le faire, valide expérimentalement ce que beaucoup pressentaient théoriquement.

La question qui s'ouvre est celle des limites de cette automatisation : là où les métriques sont ambiguës ou les objectifs difficiles à formaliser, le jugement humain reste irremplaçable. Mais pour tout ce qui peut être mesuré clairement, la recherche en IA entre dans une nouvelle ère où les machines optimisent les machines.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

IA : débats sur les goulots d'étranglement, et essais BCI en plein essor
1MIT Technology Review 

IA : débats sur les goulots d'étranglement, et essais BCI en plein essor

La startup américaine Subquadratic est sortie de sa phase de discrétion le mois dernier avec une affirmation ambitieuse : avoir résolu un goulot d'étranglement mathématique qui freine les grands modèles de langage depuis près d'une décennie. Leur approche consiste à réduire drastiquement le nombre de calculs que les transformeurs doivent effectuer pour générer des réponses, ce qui produirait des modèles plus rapides, moins coûteux et bien moins énergivores que tout ce qui existe actuellement sur le marché. Parallèlement, le domaine des interfaces cerveau-ordinateur (BCI) connaît une accélération notable : Casey Harrell, atteint de la maladie de Charcot (SLA), est décrit comme le premier "utilisateur avancé" d'un implant cérébral qui lui permet de maintenir une activité professionnelle, de renouer avec ses proches et de lire des histoires à sa fille. En 2026, la Chine est devenue le premier pays à approuver officiellement une BCI à usage médical. Sur le plan politique, le sénateur Bernie Sanders a dévoilé une proposition de loi visant à créer un fonds souverain américain en intelligence artificielle, financé par une taxe unique sur les actions des grandes entreprises du secteur, avec des versements annuels directs aux citoyens américains. Ces développements signalent des mutations profondes dans l'industrie technologique. Si la technique de Subquadratic est confirmée, elle pourrait redistribuer les cartes dans la course aux LLM en rendant obsolètes les avantages concurrentiels liés à la puissance brute de calcul, un domaine où des entreprises comme Nvidia et les grands hyperscalers ont investi des dizaines de milliards de dollars. Du côté des BCI, l'accélération des essais cliniques ouvre des perspectives concrètes pour des millions de personnes atteintes de paralysie ou de maladies neurodégénératives. Deux études publiées dans Nature viennent toutefois tempérer l'enthousiasme ambiant autour de l'IA : elles suggèrent que l'utilisation intensive de ces outils affaiblirait les capacités cognitives des médecins et des ingénieurs, un phénomène que certains observateurs qualifient de "désqualification professionnelle par surinvestissement technologique." Le contexte global reflète une industrie à un tournant. Chez Amazon, des ingénieurs ayant témoigné lors de réunions internes en faveur d'un ralentissement de la construction de centres de données font l'objet d'enquêtes disciplinaires pouvant aller jusqu'au licenciement, révélant les tensions croissantes entre salariés et direction sur les enjeux environnementaux et éthiques du déploiement massif de l'IA. Sur le plan géopolitique, des investisseurs chinois auraient discrètement acquis des parts dans SpaceX avant son introduction en bourse, tandis que Washington craint que Pékin ait obtenu l'accès à l'une des machines les plus avancées du fabricant de semi-conducteurs ASML. La proposition Sanders s'inscrit dans un débat plus large sur qui doit bénéficier des gains économiques de l'IA, à l'heure où la pratique du "tokenminning", réduire sa consommation de tokens face à des coûts en spirale, commence à remplacer le "tokenmaxxing" chez les professionnels tech les plus intensifs.

UELa révélation que Pékin aurait obtenu l'accès à une machine ASML (fabricant néerlandais stratégique de semi-conducteurs) soulève des enjeux de sécurité économique directement pertinents pour l'UE, et les études Nature sur la déqualification cognitive par l'IA concernent l'ensemble des travailleurs européens.

💬 Si Subquadratic a vraiment réduit drastiquement les calculs des transformeurs, c'est pas une amélioration marginale, c'est l'avantage compétitif des hyperscalers qui s'effondre parce qu'ils ont tout misé sur la puissance brute. Bon, à confirmer en dehors de leur propre comm. Ce qui m'inquiète autant, c'est les deux études Nature sur la déqualification cognitive : médecins et ingénieurs qui utilisent intensivement ces outils perdraient en compétences, et presque personne n'en fait les gros titres.

RecherchePaper
1 source
Les agents de recherche IA n'échouent pas à chercher, mais à poser les bonnes questions face aux requêtes ambiguës
2The Decoder 

Les agents de recherche IA n'échouent pas à chercher, mais à poser les bonnes questions face aux requêtes ambiguës

Les agents de recherche IA basés sur l'intelligence artificielle échouent rarement à cause de la recherche elle-même lorsqu'ils mènent des investigations en plusieurs étapes. Leur véritable faiblesse est ailleurs : ils ne demandent pas de clarification à l'utilisateur quand une requête est ambiguë. C'est ce que révèle un nouveau benchmark baptisé DiscoBench, conçu spécifiquement pour évaluer ce comportement. Les résultats sont frappants : les modèles qui persistent à relancer des recherches multiples plutôt que de poser une question de suivi obtiennent une précision de seulement 51,9 %, un score inférieur à celui obtenu en devinant simplement la réponse. Même le modèle le plus performant du test ne dépasse pas 43 % de précision globale. Lorsque l'ambiguïté est retirée des requêtes, la précision grimpe jusqu'à 40 points de pourcentage. Ce constat a des implications concrètes pour tous les usages professionnels des agents IA de recherche, des assistants documentaires aux outils d'aide à la décision. Un agent qui interprète mal une demande floue et fonce vers une réponse erronée, plutôt que de demander une précision, produit des résultats peu fiables malgré des capacités de recherche techniquement solides. Pour les entreprises qui déploient ces outils, cela signifie qu'améliorer la qualité des réponses passe autant par l'apprentissage du dialogue que par l'optimisation des moteurs de recherche sous-jacents. Ce travail s'inscrit dans une réflexion plus large sur les limites des agents autonomes multi-étapes, un axe de recherche en pleine expansion à mesure que ces systèmes gagnent en autonomie. La capacité à reconnaître l'incertitude et à interagir avec l'utilisateur, plutôt que de produire une réponse à tout prix, apparaît comme un enjeu central pour la fiabilité future de ces agents.

💬 Le vrai problème des agents de recherche, c'est pas qu'ils cherchent mal, c'est qu'ils n'osent jamais dire "je comprends pas ta question". Un score sous celui du pur hasard quand ils s'entêtent à relancer des recherches plutôt que de demander une précision, ça remet les pendules à l'heure : la fiabilité d'un agent IA se joue autant dans sa capacité à dialoguer que dans celle à chercher. Bon courage aux boîtes qui déploient ces outils en pensant que le moteur de recherche suffit à tout.

RecherchePaper
1 source
Des chercheurs ont entraîné un agent de recherche IA open source, Harness-1, qui surpasse GPT-4.5 dans le rappel d'informations pertinentes
3VentureBeat AI 

Des chercheurs ont entraîné un agent de recherche IA open source, Harness-1, qui surpasse GPT-4.5 dans le rappel d'informations pertinentes

Des chercheurs de l'Université de l'Illinois à Urbana-Champaign (UIUC), de l'UC Berkeley et de la plateforme de bases de données vectorielles Chroma ont présenté Harness-1, un agent de recherche open source de 20 milliards de paramètres, construit sur le modèle gpt-oss-20B d'OpenAI. Évalué sur huit benchmarks complexes couvrant des recherches web ouvertes, des rapports financiers déposés auprès de la SEC, des bases de données de brevets de l'USPTO et des tâches de raisonnement multi-sources, Harness-1 atteint un score moyen de 73% en rappel d'informations pertinentes. Il devance ainsi GPT-5.4 (70,9%) et le meilleur concurrent open source, Tongyi DeepResearch 30B, de 11,4 points de pourcentage. Seul Opus-4.6 parvient à le surpasser légèrement en performance globale. Le modèle est disponible immédiatement sous licence Apache 2.0, avec les poids publiés sur Hugging Face. Sa formation a été réalisée via Tinker, une API d'entraînement distribuée développée par Thinking Machines. Ce résultat compte pour l'industrie parce qu'il invalide une hypothèse répandue: celle selon laquelle la performance sur des tâches de recherche complexe dépend avant tout de la taille du modèle. Harness-1, avec ses 20 milliards de paramètres, surpasse des systèmes propriétaires supposés atteindre des centaines de milliards voire des milliers de milliards de paramètres, comme GPT-5.4, Sonnet-4.6 ou Kimi-K2.5. Pour les entreprises qui doivent faire analyser de manière autonome des milliers de documents internes, de dossiers financiers ou de contrats, c'est une ouverture concrète: un modèle open source, modifiable et déployable sans coût de licence, capable de tenir la comparaison avec les solutions fermées les plus avancées du marché. La clé de cette performance réside dans une architecture qui rompt avec l'approche dominante. Jusqu'ici, les agents de recherche souffraient d'une forme d'"amnésie" au cours de sessions longues: ils oubliaient leurs requêtes initiales, retournaient sur des documents déjà rejetés ou perdaient le fil des affirmations à vérifier. La solution habituelle consistait à forcer les modèles à relire en permanence une transcription croissante de toutes leurs actions, alourdissant la fenêtre de contexte à chaque étape. Harness-1 externalise cette gestion d'état vers un environnement logiciel structuré, libérant la mémoire de travail du modèle pour le raisonnement pur. Ce principe rejoint ce qu'Anthropic a démontré avec Claude Code: ce qui détermine la performance d'un agent autonome n'est pas seulement le modèle brut, mais la qualité de l'environnement dans lequel il opère.

UELes entreprises européennes traitant des volumes importants de documents (contrats, rapports financiers, brevets) peuvent désormais déployer un agent de recherche open source compétitif sans contraintes de licence, réduisant leur dépendance aux solutions propriétaires américaines.

💬 20 milliards de paramètres qui coiffent GPT-4.5 sur des benchmarks de recherche complexe, ça remet à plat l'idée que la taille fait tout. La vraie astuce, c'est l'externalisation de l'état: fini l'agent qui se perd dans son propre historique à mi-session, un environnement structuré gère la mémoire en dehors du modèle, et le raisonnement a enfin de l'air. Apache 2.0, poids sur HuggingFace, je vois les premiers POC d'ici un mois.

RecherchePaper
1 source
Les agents IA de codage trouvent le bon fichier mais passent à côté des lignes essentielles, selon une étude
4The Decoder 

Les agents IA de codage trouvent le bon fichier mais passent à côté des lignes essentielles, selon une étude

Les agents de codage dopés à l'intelligence artificielle, comme Claude Code d'Anthropic ou Codex d'OpenAI, souffrent d'un angle mort précis : ils localisent correctement le fichier contenant un bug, mais ratent la majorité des lignes critiques à l'intérieur de ce fichier. C'est ce que révèle SWE-Explore, un nouveau benchmark conçu spécifiquement pour évaluer la phase d'exploration du code, c'est-à-dire la recherche et la navigation dans une base de code, séparément de la phase de correction proprement dite. C'est une première dans l'évaluation des outils de développement automatisé. Ce découplage entre exploration et réparation change la façon d'interpréter les performances des agents de codage. Jusqu'ici, les benchmarks dominants comme SWE-bench mesuraient uniquement le résultat final : le bug est-il corrigé ou non ? SWE-Explore montre qu'un agent peut échouer non pas parce qu'il ne sait pas corriger le code, mais parce qu'il n'a pas identifié les bonnes lignes à modifier. Sans contexte suffisant, même le meilleur algorithme de correction produit un patch inutile. Les développeurs qui s'appuient sur ces outils en production s'exposent donc à des corrections en apparence valides mais ciblant les mauvaises sections. Ce travail s'inscrit dans une dynamique de remise en question des métriques utilisées pour comparer les agents de développement. L'industrie investit massivement dans ces outils, GitHub Copilot, Cursor, Devin, et les entreprises les vendent sur des taux de résolution de tickets. SWE-Explore suggère que ces chiffres masquent une faiblesse structurelle en amont : la compréhension fine d'une base de code existante reste un problème ouvert, et le résoudre conditionne tout le reste.

UELes développeurs français et européens qui s'appuient sur des agents de codage IA en production s'exposent à des corrections en apparence valides mais ciblant les mauvaises sections de code, une limite structurelle à évaluer avant tout usage professionnel critique.

💬 Ça explique des trucs que j'ai vécus : le patch arrive, il compile, les tests passent, et pourtant le bug est toujours là parce que l'agent a retouché le mauvais endroit. SWE-Explore met le doigt dessus avec rigueur, en séparant la phase de navigation de la phase de correction, ce qui n'avait jamais été fait proprement. Les éditeurs vont devoir intégrer ça dans leurs benchmarks marketing, parce que vendre sur des taux de résolution de tickets quand la moitié du problème est en amont, c'est se raconter des histoires.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic