
Quatre agents IA coordonnés en temps réel surpassent Claude Opus 4.8 sur des tâches de codage en entreprise
Des chercheurs de Coral AI Labs, en collaboration avec plusieurs universités, ont présenté AgentRadio, une couche de communication asynchrone permettant à des agents d'intelligence artificielle de coordonner leur travail en temps réel sans interrompre leurs tâches en cours. Testée sur le benchmark SWE-Atlas QnA, qui évalue la capacité d'agents à répondre à des questions complexes sur des dépôts de code de production, une équipe de quatre agents s'appuyant sur AgentRadio a quasiment doublé le taux de réussite obtenu par quatre agents Claude Code travaillant de façon indépendante. Pour comparaison, un agent unique tournant sur Claude Opus 4.6 ne résout que 32,3% des tâches du benchmark, un taux qui grimpe à 57,2% avec la version plus récente Opus 4.8, mais qui reste inférieur aux performances obtenues grâce à la coordination via AgentRadio. Les auteurs de l'étude, Xinxing Ren, Caelum Forder et Peter Carroll, expliquent que leur système permet aux agents d'échanger leurs découvertes intermédiaires entre leurs propres étapes d'exécution, plutôt que d'attendre une phase de révision formelle.
Cette avancée a une portée pratique directe pour les entreprises qui déploient des agents IA sur leurs bases de code volumineuses. Comprendre un codebase d'entreprise exige souvent d'exécuter le logiciel, de tracer des chemins d'exécution à travers de multiples fichiers et de synthétiser des preuves sur de longues périodes, un exercice où les agents uniques échouent fréquemment à cause de ce que les chercheurs appellent un "problème de couverture" : au fil de l'enquête, le plan initial devient difficile à réviser et les découvertes tardives ne se propagent pas toujours à l'ensemble du raisonnement. En permettant à plusieurs agents de partager en temps réel une information critique, comme un fichier de configuration erroné ou un bug détecté en cours de route, AgentRadio évite qu'un agent poursuive une exploration devenue caduque. Pour les praticiens de l'IA, ce résultat démontre qu'une architecture de coordination bien pensée peut surpasser une simple montée en puissance du modèle ou de la capacité de calcul.
Ce travail s'inscrit dans un contexte où les agents IA basés sur de grands modèles de langage sont de plus en plus sollicités pour des tâches longues et complexes, impliquant de multiples outils et environnements. Diviser le travail entre plusieurs agents semble une solution naturelle, mais la plupart des systèmes multi-agents existants ne sont pas conçus pour ce type de coordination. Les chercheurs identifient plusieurs schémas défaillants dans les architectures actuelles : les agents "parallèles mais isolés", qui ne communiquent pas du tout entre eux, et les agents "parallèles mais synchronisés par rounds", qui ne peuvent échanger des informations qu'à des points de synchronisation stricts, forçant chacun à attendre la fin d'un cycle avant de pouvoir partager ses résultats intermédiaires. Cette rigidité s'avère particulièrement problématique pour la compréhension de code, où les sous-tâches sont hautement interdépendantes et ne peuvent pas être simplement décomposées puis fusionnées en fin de processus. À mesure que les entreprises confient des tâches toujours plus ambitieuses à des flottes d'agents IA, l'architecture de coordination pourrait devenir un facteur de performance aussi déterminant que le choix du modèle sous-jacent lui-même.
Quatre agents qui se parlent en temps réel pendant qu'ils bossent, plutôt qu'à la fin, ça résout un problème que je vois tous les jours : l'agent qui continue de creuser une piste morte parce que personne ne lui a dit qu'un autre venait de trouver le vrai bug. Le chiffre est parlant, la coordination bat carrément la montée en gamme du modèle (Opus 4.6 vers 4.8). Reste la question qui compte : ça tient sur un vrai repo d'entreprise avec ses dépendances tordues, ou juste sur le benchmark qui va bien.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



