Aller au contenu principal
Outils · Outil ·

L'ingénierie du contexte dans le harnais : 4 mécanismes contre la saturation et la perte d'objectif sur les tâches longues

Un guide de conception publié par AWS Samples pour les agents de codage cloud autonomes identifie deux pannes récurrentes des agents dits « superficiels » : la saturation du contexte et la perte d'objectif, l'agent finissant par oublier sa consigne initiale sur les tâches longues. Selon AWS, la solution vient du « harness », la couche logicielle qui entoure le modèle, et non du modèle lui-même. Le rapport Context Rot de Chroma, qui a testé 18 modèles dont GPT-4.1, Claude 4, Gemini 2.5 et Qwen3, montre que les performances se dégradent avec la longueur du contexte, même sur des tâches de récupération simples. Manus rapporte qu'une tâche type mobilise environ 50 appels d'outils, avec un ratio de tokens entrée/sortie proche de 100 pour 1. LangChain Deep Agents décharge sur disque toute réponse d'outil dépassant 20 000 tokens et tronque les anciens appels dès que le contexte atteint 85 % de la fenêtre du modèle. Claude Code plafonne sa mémoire automatique à 200 lignes ou 25 Ko, et remplace par une simple référence tout fichier relu dépassant 5 000 tokens après compaction.

2 min de lecturePertinence 54

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette architecture change la fiabilité concrète des agents sur des tâches de plusieurs dizaines de minutes et plusieurs centaines d'appels d'outils, un scénario de plus en plus courant en développement logiciel assisté par IA. Le guide d'Anthropic sur l'ingénierie du contexte explique le mécanisme sous-jacent : l'attention d'un transformeur crée des relations n² entre tokens, si bien que chaque token ajouté consomme un budget d'attention fini. Agrandir la fenêtre de contexte n'est donc pas une solution miracle, car une information présente dans le contexte peut rester mal exploitée par le modèle. Pour les équipes qui construisent des agents en production, l'effort d'ingénierie se déplace du choix du modèle vers l'architecture du harnais, avec des conséquences directes sur le coût et le taux d'échec des tâches longues. Chez Claude Code, un sous-agent de recherche peut lire 6 100 tokens de fichiers et ne renvoyer que 420 tokens de résultat à l'agent parent.

Cette évolution traduit une bascule plus large dans l'industrie : la taille de la fenêtre de contexte, longtemps présentée comme la réponse technique évidente, cède la place à une discipline d'ingénierie logicielle appliquée aux agents. Amazon Bedrock AgentCore l'illustre à l'échelle : un agent coordinateur y lance trois sous-agents de navigation web en parallèle, chacun isolé dans sa propre MicroVM, et un sous-agent analyste ne reçoit que leurs résultats structurés, pour un temps d'exécution estimé par AWS entre 4 et 6 minutes, contre jusqu'à trois fois plus long en traitement séquentiel. OpenAI, avec Codex, développe des approches comparables de gestion de la mémoire et de l'état. La compaction, qui résume une conversation proche de la limite puis relance le contexte à partir de ce résumé, reste le point le plus délicat : chez Claude Code, le prompt de compaction est conçu pour préserver les décisions d'architecture, les bugs non résolus et les détails d'implémentation, car un résumé mal calibré risque d'effacer la contrainte qui comptait le plus.

Impact France / UEChamp produit par Le Fil IA

Les équipes européennes qui développent des agents de codage en production peuvent appliquer directement ces techniques d'architecture du harnais pour réduire couts et taux d'échec, sans qu'aucune entité ou régulation française ou européenne ne soit impliquée.

À lire ensuite

01Au-delà du prompt : l'ingénierie de contexte pour l'IA en production35InfoQ AIOutils 02L'ingénierie de prompts contre celle des boucles et des graphes : ce qui change à chaque niveau32MarkTechPostOutils 03Les agents IA ne se trompent pas avec assurance à cause d'un mauvais contexte, mais d'une mauvaise ingénierie des données43VentureBeat AIOutils 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.