Aller au contenu principal
NVIDIA lance DeepStream 9.1 : l'IA agentique arrive dans la vision par IA avec 13 compétences et un suivi 3D multi-caméra
OutilsMarkTechPost · 2 min de lecture

NVIDIA lance DeepStream 9.1 : l'IA agentique arrive dans la vision par IA avec 13 compétences et un suivi 3D multi-caméra

Source originale ↗·

NVIDIA vient de publier DeepStream 9.1, une mise à jour majeure de sa plateforme d'analyse vidéo par intelligence artificielle. Basé sur GStreamer, DeepStream permet le traitement de flux multiples avec décodage accéléré par matériel, inférence TensorRT et suivi d'objets sur GPU NVIDIA. Cette version 9.1 apporte cinq ajouts notables : treize compétences agentiques destinées aux agents de codage comme Claude Code, Codex ou Cursor, une fonction de suivi 3D multi-caméras baptisée MV3DT, un outil de calibration automatique nommé AutoMagicCalib, la prise en charge de JetPack 7.2 pour les appareils périphériques Jetson Orin et Thor, ainsi qu'un dépôt GitHub open source unifié sous licences CC-BY-4.0 et Apache-2.0. La fonctionnalité MV3DT projette les détections de plusieurs caméras calibrées dans un système de coordonnées 3D partagé, associe les observations d'un même objet entre les différentes vues, puis lui attribue un identifiant global unique. Le processus s'appuie sur trois modèles de détection disponibles nativement, dont PeopleNetTransformer et RT-DETR 2D, et utilise le protocole de messagerie MQTT pour faire correspondre les trajectoires entre caméras dans l'espace 3D.

Cette avancée répond à un problème récurrent de la vidéosurveillance intelligente : jusqu'ici, suivre un même objet ou une même personne à travers plusieurs caméras exigeait une calibration manuelle fastidieuse, souvent réalisée à l'aide de mires en damier, et des calculs complexes. Avec AutoMagicCalib, ce processus est automatisé : le système analyse les objets déjà suivis dans des vidéos ou flux existants pour estimer les paramètres intrinsèques des caméras comme la focale ou la distorsion optique, ainsi que leurs paramètres extrinsèques comme la position et l'orientation dans l'espace. L'utilisateur n'a plus qu'à fournir une image du plan des lieux et quelques points d'alignement. Pour les développeurs, l'intérêt est double : gain de temps considérable sur le déploiement de systèmes de vidéosurveillance intelligente, et surtout un accès simplifié via le langage naturel plutôt que par édition manuelle de fichiers de configuration, grâce à l'intégration directe avec les agents de codage IA.

Cette évolution s'inscrit dans la tendance plus large de NVIDIA à rendre ses outils d'infrastructure IA pilotables par des agents autonomes plutôt que configurables uniquement par des experts. Les résultats de MV3DT s'exportent sous trois formes complémentaires : un affichage à l'écran avec grille de flux et boîtes englobantes 2D/3D, une vue aérienne cartographiant les trajectoires, et des messages Kafka transportant des métadonnées détaillées par image comme l'identifiant du capteur et la position 3D de l'objet. En interne, le pipeline de calibration automatique combine cinq étapes techniques, dont un ajustement de faisceaux et un raffinement optionnel par transformeur de géométrie visuelle (VGGT), utile lorsque les objets suivis se déplacent peu. L'installation reste accessible : il suffit de cloner le dépôt GitHub officiel et de copier les compétences dans le répertoire de l'agent utilisé, qu'il s'agisse de Codex, Claude Code ou un outil similaire, ouvrant la voie à une adoption plus large de la vidéo-analyse intelligente pilotée par IA.

💬 L'analyse de Mathieu

Bon, sur le papier c'est du bon boulot d'ingénieurie, mais regarde bien ce qui se passe : NVIDIA arrête de vendre juste du matos pour la vidéosurveillance, il vend l'accès en langage naturel à des systèmes qui coûtaient des semaines d'intégration. Le vrai changement, c'est pas MV3DT ou AutoMagicCalib en soi, c'est que Claude Code ou Cursor peuvent maintenant configurer un système de suivi multi-caméra sans qu'un expert touche à un fichier YAML. Reste à voir si ça tient en prod sur un vrai site avec 40 caméras mal calibrées, mais la direction est claire : l'agentique grignote la couche config des infras lourdes, pas juste les scripts Python du dimanche.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Nous Research lance Hermes Agent Profile Builder : identité, modèle, compétences et serveurs MCP dans un tableau de bord unique
1MarkTechPost 

Nous Research lance Hermes Agent Profile Builder : identité, modèle, compétences et serveurs MCP dans un tableau de bord unique

Nous Research a publié le Profile Builder pour son agent open source Hermes, une interface graphique intégrée au tableau de bord local du projet accessible depuis un navigateur à l'adresse 127.0.0.1:9119. Jusqu'ici, configurer un agent Hermes demandait plusieurs étapes en ligne de commande : définir une identité, choisir un modèle et un fournisseur, activer des compétences, connecter des serveurs MCP. Le Profile Builder regroupe toutes ces opérations dans un formulaire guidé en cinq étapes. Le premier champ définit le nom et la description de l'agent, le nom servant également d'alias de commande dans le terminal. Viennent ensuite le choix du modèle et du fournisseur parmi Nous Portal, OpenRouter, NVIDIA, OpenAI ou tout endpoint compatible OpenAI, puis l'activation des compétences intégrées, l'installation depuis un catalogue externe via le Skills Hub, et enfin l'ajout de serveurs MCP par URL ou par commande locale. Chaque configuration produit un profil isolé : un répertoire autonome contenant son propre fichier config.yaml, ses variables d'environnement, son fichier de personnalité SOUL.md, sa mémoire, ses sessions, ses tâches planifiées et sa base de données d'état. L'intérêt principal de cette approche est la possibilité de faire tourner plusieurs agents spécialisés sur une même machine sans qu'ils partagent le moindre état. Un agent dédié au code et un agent de veille documentaire restent rigoureusement cloisonnés : mémoire séparée, credentials distincts, verrous sur les tokens pour éviter les conflits d'accès. Concrètement, un développeur peut configurer un assistant de programmation couplé à un modèle de code, un serveur MCP pour le système de fichiers et des compétences Git, pendant qu'un second profil gère une veille automatisée avec des compétences d'extraction web. Le builder abaisse significativement le seuil d'entrée : là où la configuration CLI exigeait de connaître chaque commande dans le bon ordre, le formulaire guide l'utilisateur sans supposer de familiarité avec l'outillage interne. Hermes est l'agent auto-améliorant open source de Nous Research, disponible en CLI, en application desktop et sur des plateformes de messagerie. Les compétences de l'agent reposent sur des fichiers SKILL.md dont seules les descriptions courtes sont chargées par défaut, le contenu complet n'étant consulté qu'en cas de besoin, ce qui évite d'alourdir les requêtes. Les serveurs MCP, conformes au protocole Model Context Protocol, permettent d'exposer des outils externes, qu'il s'agisse de services HTTP distants ou de processus stdio locaux. Le Profile Builder n'écrase pas le CLI, il en reproduit la logique dans une interface plus accessible : les deux chemins écrivent dans les mêmes fichiers de profil. Cette sortie s'inscrit dans une tendance plus large où les projets d'agents open source cherchent à réduire la friction de configuration pour toucher un public plus large que les seuls développeurs familiers de la ligne de commande.

OutilsOutil
1 source
NVIDIA lance un kit d'outils BioNeMo Agent pour accélérer l'IA des chercheurs en sciences de la vie sur Claude Science
2NVIDIA AI Blog 

NVIDIA lance un kit d'outils BioNeMo Agent pour accélérer l'IA des chercheurs en sciences de la vie sur Claude Science

NVIDIA et Anthropic ont annoncé cette semaine l'intégration du BioNeMo Agent Toolkit de NVIDIA à Claude Science, le nouvel environnement de travail conçu par Anthropic pour la recherche scientifique. Claude Science permet aux chercheurs de dialoguer en langage naturel avec des agents capables de piloter leurs travaux de bout en bout, sans configurer manuellement modèles, points d'accès ou environnements logiciels. Grâce à cette intégration, ces agents peuvent désormais s'appuyer sur les modèles accélérés de NVIDIA, ses bibliothèques et ses microservices NIM, dont des outils spécialisés comme Evo 2, Boltz-2 et OpenFold3, pour analyser des séquences génomiques, prédire des structures de protéines ou concevoir des molécules candidates. NVIDIA précise que 18 des 20 plus grandes entreprises pharmaceutiques mondiales utilisent déjà BioNeMo, signe de l'ancrage de la plateforme dans l'industrie. Le toolkit fonctionne en transformant les capacités accélérées de NVIDIA en compétences activables par les agents, qui sélectionnent l'outil adapté, préparent les données d'entrée et exécutent le flux de travail, tout en se connectant aux ressources de calcul NVIDIA où qu'elles soient déployées. Cette avancée s'inscrit dans la transition vers une recherche scientifique pilotée par des agents autonomes, capables de raisonner, planifier et orchestrer des workflows complexes sans intervention humaine constante. Concrètement, un chercheur peut désormais demander à Claude de concevoir de multiples inhibiteurs potentiels à partir d'une mutation antigénique connue associée à un cancer, l'agent se chargeant alors d'enchaîner prédiction, optimisation et validation à haut débit grâce aux microservices NIM. L'enjeu est de taille pour l'industrie pharmaceutique et les laboratoires de recherche, où la vitesse d'itération conditionne directement le rythme des découvertes en génomique, protéomique, conception moléculaire et ingénierie des protéines. En intégrant le calcul accéléré directement dans l'environnement où s'effectue le raisonnement scientifique, NVIDIA et Anthropic cherchent à supprimer les frictions techniques qui ralentissent habituellement le passage de l'hypothèse à l'expérimentation. Cette intégration répond à un constat de fond : un agent scientifique autonome ne raisonne jamais isolément, il doit enchaîner des tâches très diverses, du criblage de bibliothèques de composés à l'analyse de contexte génomique, en passant par la génération de conformères ou la comparaison de réponses à des perturbations cellulaires, avant de recommander la prochaine expérience. La rapidité de chaque étape dépend directement de la performance des outils sous-jacents. C'est pourquoi NVIDIA met en avant des gains de vitesse concrets au sein du BioNeMo Agent Toolkit, comme Parabricks, qui réduit l'analyse génomique de plusieurs heures à quelques minutes, ou RAPIDS-singlecell, développé par le collectif scverse, qui ramène un flux de prétraitement et de clustering portant sur 1,3 million de cellules de 52 minutes à seulement 25 secondes.

OutilsActu
1 source
Concevoir des agents d'analyse financière pilotés par compétences avec Claude, Python et MCP
3MarkTechPost 

Concevoir des agents d'analyse financière pilotés par compétences avec Claude, Python et MCP

Un tutoriel technique récemment publié détaille comment reproduire, en Python pur, l'architecture du dépôt open source financial-services d'Anthropic, conçu pour l'analyse financière automatisée par agents IA. Le projet s'appuie sur le modèle Claude Sonnet 4.6 via l'API Messages d'Anthropic et sur un dépôt GitHub structuré en plugins d'agents, plugins verticaux, intégrations partenaires et cookbooks d'agents managés. La démarche consiste à cloner le dépôt, puis à cartographier automatiquement ses composants grâce à un script Python qui parcourt les répertoires à la recherche de fichiers SKILL.md, ces derniers documentant les compétences ou playbooks financiers disponibles pour les agents. Un registre de compétences est ensuite construit en analysant les métadonnées YAML de chaque fichier SKILL.md, permettant de créer un objet réutilisable baptisé SkillAgent, capable d'injecter des playbooks financiers sélectionnés dans les requêtes envoyées à l'API Claude, tout en gérant une boucle itérative d'utilisation d'outils pour exécuter des calculs Python et générer des fichiers. Le tutoriel s'appuie également sur des bibliothèques comme pandas, openpyxl, pyyaml et matplotlib pour le traitement des données et la génération de livrables. Cette approche illustre une tendance de fond dans le déploiement d'agents IA en entreprise: plutôt que de coder en dur des workflows financiers complexes, les concepteurs cherchent à externaliser le savoir-faire métier dans des fichiers de compétences structurés et lisibles, que les agents peuvent découvrir et charger dynamiquement selon la tâche demandée. Concrètement, le système démontré permet de produire une valorisation par flux de trésorerie actualisés (discounted cash flow), une carte de sensibilité croisant coût moyen pondéré du capital et taux de croissance terminal, une analyse de sociétés comparables avec sortie Excel formatée, ainsi qu'un mémo d'investissement rédigé pour un comité de private equity. Pour les équipes financières et les développeurs d'outils d'analyse, cette architecture modulaire promet de réduire le temps de développement d'agents spécialisés tout en gardant un contrôle fin sur les connaissances injectées dans chaque requête au modèle. Le dépôt financial-services d'Anthropic s'inscrit dans une stratégie plus large de l'entreprise visant à fournir des briques prêtes à l'emploi pour des cas d'usage sectoriels, à l'image des connecteurs MCP (Model Context Protocol) que le tutoriel identifie également dans la configuration du dépôt. Ce protocole, porté par Anthropic depuis fin 2024, vise à standardiser la connexion entre modèles de langage et sources de données ou outils externes. Le tutoriel va jusqu'à inspecter une spécification de déploiement d'agent managé sans toutefois déclencher de requête de déploiement réelle, une précaution qui souligne le caractère encore expérimental de ces architectures d'agents autonomes appliquées à des tâches financières sensibles.

OutilsOutil
1 source
LangChain lance Deep Agents : un environnement d'exécution structuré pour la planification, la mémoire et l'isolation du contexte dans les agents IA multi-étapes
4MarkTechPost 

LangChain lance Deep Agents : un environnement d'exécution structuré pour la planification, la mémoire et l'isolation du contexte dans les agents IA multi-étapes

LangChain vient de lancer Deep Agents, une bibliothèque autonome conçue pour les agents IA multi-étapes qui nécessitent planification, gestion de contexte et isolation des sous-tâches. Contrairement aux agents classiques qui fonctionnent bien sur des boucles courtes d'appels d'outils, Deep Agents cible les tâches longues, avec état et produisant de nombreux artefacts, un cas d'usage où la plupart des systèmes existants commencent à flancher. L'enjeu est important pour les développeurs qui construisent des agents capables de mener des recherches approfondies, de générer du code sur plusieurs itérations ou d'effectuer des analyses complexes. Jusqu'ici, la gestion de la planification, du stockage intermédiaire et de la délégation de sous-tâches était entièrement à la charge des équipes applicatives. Deep Agents intègre ces mécanismes directement dans le runtime par défaut, réduisant la friction à l'implémentation tout en restant compatible avec LangGraph pour l'exécution durable, le streaming et les workflows human-in-the-loop. Concrètement, la bibliothèque embarque d'office un outil de planification writetodos pour décomposer les tâches en étapes traçables, un ensemble d'outils filesystem (readfile, writefile, editfile, glob, grep), un accès shell sandboxé via execute, et un outil task pour instancier des sous-agents isolés. La gestion de contexte repose sur l'écriture des sorties volumineuses en fichiers plutôt qu'en prompt actif, évitant ainsi le dépassement de la fenêtre de contexte. Plusieurs backends sont supportés, StateBackend, FilesystemBackend, LocalShellBackend, StoreBackend et CompositeBackend, le mode par défaut étant StateBackend, qui stocke un filesystem éphémère dans l'état LangGraph pour un thread unique. La mémoire long terme est également prévue via le LangGraph Memory Store, permettant à l'agent de persister et retrouver des informations entre conversations. LangChain positionne Deep Agents comme point d'entrée privilégié pour les développeurs ayant des besoins complexes, tout en laissant ouverte la possibilité de basculer vers des agents LangChain plus simples ou des workflows LangGraph personnalisés selon les besoins.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic