Créer une mémoire d'agent avec NVIDIA NeMo Agent Toolkit et Amazon S3 Vectors
Dans un précédent article consacré à la mémoire persistante des systèmes d'IA multi-agents, les auteurs expliquaient pourquoi l'ingénierie de la mémoire est devenue une discipline fondamentale en production, et comment Amazon S3 Vectors, une capacité d'Amazon S3, répond aux exigences d'une mémoire d'agent : recherche sémantique, métadonnées riches, cohérence forte et montée en charge élastique. Cette nouvelle publication passe à la mise en œuvre. Elle montre comment utiliser S3 Vectors comme couche de mémoire persistante au sein du NVIDIA NeMo Agent Toolkit (NAT), déployé sur Amazon EKS (Elastic Kubernetes Service) pour garder un contrôle opérationnel complet, avec un cas d'usage de recherche en investissement confié à plusieurs agents. NAT est un framework open source de construction, de profilage et d'optimisation d'agents, compatible avec Strands Agents, LangChain, LlamaIndex, CrewAI ou des implémentations maison. Il couvre l'orchestration (workflows composables lancés avec « nat run » ou en service avec « nat serve »), le profilage (jetons, latence, débit), l'évaluation (exactitude, pertinence du contexte, ancrage des réponses, trajectoire de l'agent) et l'optimisation automatique d'hyperparamètres comme la température, le topp ou le maxtokens.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Son module mémoire stocke l'historique des conversations, les préférences des utilisateurs et les connaissances à long terme d'une invocation à l'autre. Il est extensible : un fournisseur personnalisé implémente l'interface MemoryEditor, qui impose trois méthodes (additems, search, removeitems). Les données passent par le modèle MemoryItem, qui contient l'historique, des étiquettes, des métadonnées, un identifiant utilisateur et une chaîne de mémoire optionnelle. Les configurations héritent de la classe Pydantic MemoryBaseConfig, et NAT repère le fournisseur grâce au champ type du fichier YAML. Le type de workflow automemory_agent enveloppe un agent pour capturer et récupérer la mémoire automatiquement, sans que le modèle ait à appeler explicitement un outil dédié. Les fournisseurs intégrés sont Mem0, MemMachine, Redis et Zep.
L'enjeu est pratique pour les équipes qui exploitent des systèmes multi-agents : les fournisseurs existants couvrent les usages courants, mais ils conviennent moins quand il faut un stockage vectoriel élastique, une cohérence forte à l'écriture et un coût maîtrisé jusqu'à des milliards de vecteurs. S3 Vectors offre une recherche par similarité avec distances cosinus ou euclidienne, des métadonnées filtrables (chaînes, nombres, booléens, listes) pour cibler les requêtes, des souvenirs visibles immédiatement après insertion, ce qui facilite la coordination entre agents, et jusqu'à 2 milliards de vecteurs par index sans planification de capacité. La facturation se limite au stockage, aux écritures et aux requêtes, sans coût de ressources inactives. Écrire un fournisseur personnalisé permet ainsi de brancher ce stockage sur NAT sans changer la logique des agents, avec un déploiement sur EKS, qui laisse aux équipes la maîtrise de l'infrastructure.
Pas d'impact direct sur la France/UE