Aller au contenu principal
Outils · Tuto ·

Le cours open source de Decoding AI cartographie trois façons de faire tourner une boucle d'agent (et l'économie des fournisseurs derrière chacune)

Le développeur Paul Iusztin a publié via Decoding AI un cours open source, « Building a Coding Agent From Scratch », qui construit un agent de codage en Python nommé Decode. Le point de départ est une expérience de LangChain sur le benchmark Terminal-Bench : en changeant uniquement le harness, l'infrastructure qui fait tourner la boucle de l'agent, sans toucher au modèle, un agent est passé d'environ la 30e place à une place dans le top 5. Decode distingue trois façons d'exécuter cette même boucle autour d'un noyau sans interface propre. En mode interactif en ligne, un terminal reste connecté à une session unique en mémoire, avec une file d'attente de pilotage : les entrées de l'utilisateur ne sont injectées qu'à deux points de sécurité du cycle, avant l'appel au modèle ou à la fin du tour, via des raccourcis distincts pour orienter, mettre en attente ou interrompre l'exécution. En mode distant hors ligne, ce même noyau tourne sur un serveur via Kitaru, le runtime d'agents de ZenML déployé sur Google Cloud, les agents s'exécutant sur Modal, avec des outils lancés dans des sandbox à distance ou dans Docker en local. Le mode asynchrone en ligne se situe entre les deux : une session active délègue le travail à une file d'attente qui continue de tourner après la déconnexion du client.

2 min de lecturePertinence 44
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette architecture pèse directement sur le choix du fournisseur d'inférence. Pour un lot de 1 000 documents de 30 000 tokens d'entrée chacun et environ 500 tokens de sortie par document, un traitement via une API facturée 3 dollars par million de tokens en entrée et 15 dollars par million en sortie coûte environ 97 dollars, la mise en cache des prompts n'aidant pas puisque chaque document constitue un préfixe différent. Le même volume traité par lots sur un GPU serverless à environ 3 000 tokens par seconde revient à moins de trois heures de calcul, soit environ 13 dollars. La leçon dépasse le seul choix du modèle : un mode interactif surveillé par un humain doit privilégier une API hébergée à faible latence, tandis qu'un mode distant traitant des tickets en parallèle sans supervision doit viser le débit par dollar plutôt que la rapidité de première réponse.

Ce cours s'inscrit dans un débat plus large sur ce qui détermine la qualité d'un agent de codage, le modèle ou l'ingénierie du harness qui l'entoure. Decode illustre la légèreté possible de ce cœur logique, avec une définition d'agent tenant en une vingtaine de lignes construites sur Pydantic AI, contre environ 150 lignes pour la boucle centrale du code source de Claude Code d'Anthropic, révélé publiquement. Le reste, mémoire, gestion des compétences, bac à sable d'exécution, permissions et compaction du contexte, relève du harness et non du modèle. Le modèle de test par défaut du cours, Qwen3.6 35B, tourne sur un seul GPU H200 via Modal. Avec LangChain pour le benchmark, ZenML pour le runtime Kitaru et Modal pour l'infrastructure serverless, la couche d'orchestration s'impose comme un terrain de compétition à part entière, où le choix du fournisseur d'inférence dépendra de plus en plus du profil de latence et de volume plutôt que de la seule qualité du modèle.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01SpaceXAI en open source pour Grok : l'agent Rust, l'interface TUI et les outils derrière son CLI de code40MarkTechPostOutils 02L'IA à base d'agents à grande échelle : des standards d'entreprise sans dépendance à un fournisseur36AWS ML BlogOutils 03Berd, l'espace de travail agent open source de Block, fonctionne avec plusieurs modèles et stocke l'historique des conversations en local46VentureBeat AIOutils 
Dossier · Open weight & Open sourceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.