Aller au contenu principal
NVIDIA Nemotron et OpenAI GPT OSS arrivent sur Amazon Bedrock dans AWS GovCloud (US)
InfrastructureAWS ML Blog · 2 min de lecture

NVIDIA Nemotron et OpenAI GPT OSS arrivent sur Amazon Bedrock dans AWS GovCloud (US)

Source originale ↗·

Cette semaine, Amazon a annoncé l'arrivée de nouveaux modèles ouverts sur Amazon Bedrock, dans la région AWS GovCloud (US), un environnement cloud isolé réservé aux agences gouvernementales américaines, au secteur de la défense et du renseignement, ainsi qu'à leurs sous-traitants. Concrètement, Bedrock prend désormais en charge les modèles GPT OSS d'OpenAI (versions 120 milliards et 20 milliards de paramètres) ainsi que la famille NVIDIA Nemotron 3, comprenant Nemotron 3 Super (120 milliards de paramètres, architecture hybride de mélange d'experts n'activant que 12 milliards de paramètres par token) et les modèles Nemotron 3 Nano (versions 9B, 12B et 30B). Ces modèles fonctionnent entièrement sur une infrastructure exploitée par AWS, physiquement située aux États-Unis et administrée exclusivement par des citoyens américains, à l'intérieur du périmètre de conformité GovCloud. Cette région répond à des référentiels réglementaires stricts, dont le FedRAMP High, les niveaux d'impact 2, 4 et 5 du DoD Cloud Computing Security Requirements Guide, les règles ITAR sur le trafic d'armes, et les exigences CJIS pour les données judiciaires.

Cette annonce répond à une tension centrale pour les administrations américaines : elles doivent pouvoir exploiter des modèles d'IA aussi performants que ceux utilisés dans le secteur privé, sans jamais faire sortir de données sensibles du périmètre réglementaire qui les encadre. Jusqu'ici, l'accès aux modèles ouverts les plus avancés impliquait souvent des compromis sur la souveraineté ou la conformité des données. En intégrant GPT OSS et Nemotron directement dans Bedrock au sein de GovCloud, Amazon permet aux agences fédérales, aux équipes de renseignement et à leurs prestataires de construire des applications agentiques pour des cas d'usage concrets : analyse de renseignement, planification de missions, examen de documents d'acquisition et de contrats, analyse de journaux de sécurité, évaluation automatisée de contrôles de sécurité, synthèse multi-documents et vérification de conformité réglementaire. L'accès via une API unifiée permet en outre de changer de modèle selon le besoin sans modifier le code applicatif, ce qui simplifie l'adoption pour des équipes techniques gouvernementales souvent contraintes par des cycles d'certification longs.

Cette évolution s'inscrit dans la course plus large que se livrent les grands fournisseurs cloud pour capter la demande croissante en IA générative des administrations publiques, un marché où la confiance réglementaire pèse autant que la performance technique. Amazon Bedrock fonctionne comme une plateforme neutre donnant accès à des modèles de plusieurs fournisseurs indépendants, une stratégie qui contraste avec l'intégration verticale d'autres acteurs du cloud. L'arrivée de modèles ouverts d'OpenAI et de NVIDIA dans un environnement aussi cloisonné que GovCloud illustre aussi la normalisation des modèles à poids ouverts, autrefois cantonnés à la recherche ou aux usages commerciaux, dans des contextes de mission critique. Reste à voir combien d'autres familles de modèles ouverts suivront ce chemin vers les environnements souverains et régulés, et si cette disponibilité accélérera réellement l'adoption de l'IA agentique au sein des agences fédérales et des acteurs de la défense.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Comment déployer des opérations IA autonomes à grande échelle sur Amazon Bedrock
1AWS ML Blog 

Comment déployer des opérations IA autonomes à grande échelle sur Amazon Bedrock

Amazon Web Services a dévoilé Amazon Bedrock Ops Alert, une solution de supervision automatisée en trois couches conçue pour les organisations qui déploient des applications d'IA générative à grande échelle. Utilisé par plus de 100 000 organisations dans le monde, d'entreprises naissantes aux multinationales, Amazon Bedrock fournit l'infrastructure sur laquelle reposent des centaines de workloads de production. La nouvelle solution surveille en continu les quotas de requêtes par minute (RPM) et de tokens par minute (TPM) alloués à chaque client, détecte les anomalies opérationnelles avant qu'elles n'impactent la production, ajuste dynamiquement les seuils d'alarme, et ouvre automatiquement des tickets de support AWS enrichis en contexte. Elle intègre également un mécanisme anti-doublons qui bloque la création d'un nouveau ticket si un cas non résolu de même nature est déjà ouvert, évitant ainsi de diluer l'attention des équipes d'ingénierie. Pour les équipes SRE spécialisées en IA, l'enjeu est considérable : gérer manuellement les quotas et escalades de support à mesure que l'adoption interne s'accélère est un travail chronophage qui détourne les ingénieurs de l'innovation. Bedrock Ops Alert réduit ce surcoût opérationnel en automatisant le triage, en fournissant des notifications contextualisées directement exploitables, et en raccourcissant le temps moyen de résolution des incidents. La solution permet aussi d'anticiper les besoins d'augmentation de quotas avant que les limitations ne se matérialisent en erreurs pour les utilisateurs finaux, un gain critique dans des environnements où plusieurs modèles de fondation tournent simultanément en production. Cette annonce s'inscrit dans une tendance plus large chez AWS : réduire la friction liée à l'échelle des workloads d'IA générative sans exiger systématiquement une augmentation de quotas. Amazon Bedrock propose déjà l'inférence inter-régions géographique et, plus récemment, l'inférence inter-régions mondiale (global cross-region inference), qui route automatiquement les requêtes vers les régions AWS commerciales les mieux disponibles dans le monde entier, offrant un accès à un pool de ressources nettement plus large et une réduction de coût d'environ 10 % par rapport à l'inférence géographique classique. Le prompt caching, autre fonctionnalité optionnelle, permet quant à lui de réduire la latence et les coûts en token en évitant de recalculer des portions de contexte identiques. Ensemble, ces mécanismes forment une réponse structurée d'AWS à la pression croissante que font peser des milliers d'organisations sur une infrastructure d'IA devenue critique pour leurs opérations quotidiennes.

UELes organisations françaises et européennes utilisant Amazon Bedrock pour leurs workloads d'IA en production peuvent réduire la charge opérationnelle de leurs équipes SRE grâce à cette solution d'automatisation du monitoring et de la gestion des quotas.

InfrastructureActu
1 source
Optimiser l'entraînement des modèles sur Amazon SageMaker AI avec NVIDIA Blackwell
2AWS ML Blog 

Optimiser l'entraînement des modèles sur Amazon SageMaker AI avec NVIDIA Blackwell

Amazon Web Services a rendu disponibles sur Amazon SageMaker AI les instances P6-B200, équipées de huit GPU NVIDIA Blackwell B200, pour l'entraînement de modèles de machine learning à grande échelle. Ces GPU de nouvelle génération embarquent 180 Go de mémoire HBM par puce (268 Go sur le B300), contre des capacités bien inférieures sur les générations précédentes, et s'interconnectent via NVLink 5 qui atteint 1,8 To/s de bande passante bidirectionnelle entre GPU. La configuration cible des modèles Transformer allant de 1 à 64 milliards de paramètres, entraînés en parallélisme de données fragmentées (FSDP de PyTorch) sur un nœud unique à huit GPU. L'accès à ces instances peut être réservé via le programme Flexible Training Plan d'AWS pour bénéficier d'une capacité prévisible et d'une gestion automatisée des ressources. Cette architecture modifie concrètement ce qui est réalisable dans l'entraînement de grands modèles. Jusqu'ici, les ingénieurs se heurtaient à trois contraintes classiques : des tailles de batch limitées par la mémoire GPU, des séquences tronquées pour éviter les erreurs out-of-memory, et un fractionnement du modèle sur plusieurs nœuds qui génère une surcharge réseau importante. Avec 180 Go par GPU, certains modèles qui nécessitaient auparavant plusieurs nœuds peuvent désormais tenir sur un seul nœud à huit GPU, ce qui réduit la latence de communication, accélère les cycles d'itération et diminue les coûts d'infrastructure. Des séquences plus longues deviennent viables pour les tâches de dépendances à longue portée, et le nombre d'étapes de synchronisation des gradients diminue avec des batchs plus grands, améliorant le débit global. NVIDIA Blackwell représente la cinquième génération de Tensor Cores de la marque, et son architecture dual-chip marque une rupture par rapport aux générations Ampere et Hopper. L'explosion de la taille des modèles ces trois dernières années, de GPT-3 à 175 milliards de paramètres jusqu'aux modèles actuels dépassant le trillion, a poussé les fournisseurs cloud et les fabricants de puces à repenser conjointement leurs offres. AWS et NVIDIA ont renforcé leur partenariat autour de SageMaker pour proposer une intégration clé en main qui abstrait la gestion de l'infrastructure. Les prochaines étapes pratiques pour les équipes ML consistent à calibrer le format de précision (FP8, BF16 ou FP16 selon la taille du modèle), ajuster le checkpointing d'activations pour équilibrer mémoire et calcul, et décider si la priorité est le débit, la réduction des communications inter-GPU ou la longueur de contexte. L'enjeu pour AWS est de capter une part croissante des budgets d'entraînement de modèles fondationnels, un marché où Google Cloud et Microsoft Azure jouent également des capacités GPU Blackwell.

InfrastructureActu
1 source
Modèles ouverts, environnements fermés : Palantir déploie une IA sécurisée dans les agences US avec NVIDIA Nemotron
3NVIDIA AI Blog 

Modèles ouverts, environnements fermés : Palantir déploie une IA sécurisée dans les agences US avec NVIDIA Nemotron

Palantir a annoncé un nouveau moteur d'intelligence artificielle intégrant les modèles ouverts NVIDIA Nemotron, destiné aux agences fédérales américaines opérant dans des environnements dits "air-gapped", des infrastructures totalement isolées de tout réseau non sécurisé. Concrètement, les agences gouvernementales pourront déployer des modèles Nemotron personnalisés sur leur propre infrastructure, les entraîner sur leurs propres données et conserver la pleine propriété des modèles résultants, y compris des poids qui encodent leur connaissance opérationnelle. Le système repose sur le Sovereign AI Operating System de Palantir, une pile logicielle construite sur ses produits AIP, Ontology, Foundry et Apollo, qui gère les autorisations d'accès aux données et l'isolation architecturale. Les déploiements à grande échelle pourront s'appuyer sur la suite logicielle NVIDIA AI Enterprise. L'enjeu est considérable : le gouvernement fédéral américain emploie environ 3 millions de fonctionnaires civils et opère dans des domaines aussi variés que le commerce, la santé, l'agriculture, l'énergie, l'éducation et les transports, ce qui en fait l'une des plus grandes "entreprises" du monde. L'IA peut y rationaliser des opérations d'une complexité extrême, de la sécurité alimentaire à la gestion des infrastructures routières. Ce partenariat permet aux agences d'entrer dans une logique de "data flywheel" : les modèles s'améliorent en continu grâce aux nouvelles données et aux retours d'usage, sans que ces informations ne quittent jamais le périmètre de contrôle de l'agence. La transparence des modèles ouverts offre par ailleurs une auditabilité totale, permettant aux chercheurs indépendants d'identifier vulnérabilités, biais ou comportements inattendus, un prérequis non négociable en contexte de sécurité nationale. Cette annonce s'inscrit dans une tendance plus large qui voit les modèles ouverts s'imposer comme une alternative crédible aux systèmes propriétaires pour les institutions sensibles. L'histoire de l'open source américain, du noyau UNIX en 1969 au Linux Kernel en 1991, de GitHub à Docker, montre que la mise en commun du code a historiquement renforcé la compétitivité technologique des États-Unis. Aujourd'hui, NVIDIA pousse cette logique dans le domaine des grands modèles de langage avec Nemotron, tandis que Palantir apporte son expertise en gouvernance des données souveraines. La combinaison des deux répond à une demande croissante des États et des grandes entreprises qui veulent accéder aux capacités de l'IA frontier sans sacrifier le contrôle sur leurs données stratégiques ni dépendre d'un fournisseur cloud extérieur.

UELa démonstration qu'un déploiement IA souverain en environnement air-gapped est techniquement viable pourrait accélérer les réflexions européennes sur des architectures similaires pour les institutions publiques et défense de l'UE.

InfrastructureActu
1 source
Construire des systèmes multi-agents LangGraph serverless et scalables sur AWS avec Amazon Bedrock AgentCore
4AWS ML Blog 

Construire des systèmes multi-agents LangGraph serverless et scalables sur AWS avec Amazon Bedrock AgentCore

Amazon Web Services a présenté une architecture de référence pour déployer des systèmes multi-agents d'IA générative à grande échelle sur AWS, en combinant LangGraph, AWS Lambda, AWS Step Functions et les deux nouveaux services Amazon Bedrock AgentCore Memory et AgentCore Observability. L'approche repose sur une infrastructure entièrement serverless : les agents LangGraph sont packagés dans des conteneurs Docker exécutés sur Lambda, ce qui permet une montée en charge automatique sans gestion d'infrastructure. Pour illustrer le concept, AWS décrit un système concret de révision de campagnes marketing orchestrant trois agents spécialisés en parallèle, un agent "persona reviewer" qui évalue la résonance du contenu auprès de différents profils démographiques, un agent "validator" qui vérifie la conformité juridique et les chartes de marque, et un agent "finalizer" qui synthétise les retours en recommandations actionnables. Une interface React permet aux utilisateurs de télécharger leurs documents et de consulter les résultats en temps réel. Ce type d'architecture répond à un problème concret que rencontrent les entreprises en production : les agents IA performants en démo s'effondrent souvent sous la charge réelle, perdent le contexte entre les sessions et restent des boîtes noires difficiles à déboguer. AgentCore Memory résout la question de la mémoire en offrant à la fois un contexte conversationnel à court terme et une base de connaissances persistante entre sessions. AgentCore Observability capture quant à lui chaque invocation avec ses entrées et sorties LLM, la latence, et les métriques de chaîne d'outils sur l'ensemble des composants distribués. Pour les équipes en charge de systèmes critiques, c'est un changement de paradigme : il devient possible d'auditer exactement comment un agent a raisonné, quelle décision il a prise à quelle étape, et pourquoi. Cette publication s'inscrit dans une accélération visible chez AWS pour proposer une pile complète d'IA agentique cloud-native, face à la concurrence de Google (Vertex AI Agents) et Microsoft (Azure AI Foundry). LangGraph, développé par LangChain, s'impose progressivement comme standard de facto pour l'orchestration d'agents grâce à son modèle d'exécution en graphe orienté qui rend le flux de contrôle déterministe, parallélisable et conditionnel. L'intégration native avec Lambda et Step Functions est particulièrement stratégique pour les charges de travail "bursty" typiques des agents IA, où la demande est imprévisible et les coûts d'une infrastructure dédiée permanente seraient prohibitifs. La prochaine étape logique pour AWS sera d'étendre ces patterns à des workflows plus complexes impliquant des boucles de feedback humain et des agents à longue durée de vie, un segment encore largement inexploré en production.

InfrastructureActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic