Aller au contenu principal
LLMsAWS ML Blog · 2 min de lecture

Introduction de la mise en cache explicite des prompts pour les modèles GPT-5.6 d'OpenAI sur Amazon Bedrock

Source originale ↗·

OpenAI et Amazon Web Services ont annoncé la disponibilité générale de trois nouveaux modèles sur Amazon Bedrock : GPT-5.6 Sol, Terra et Luna. Coécrite avec Chris Dickens, ingénieur chez OpenAI, cette annonce introduit une famille segmentée en trois niveaux de capacité : Sol, taillé pour le raisonnement complexe et le codage agentique, Terra, pensé pour les charges de production quotidiennes équilibrées, et Luna, optimisé pour les tâches rapides à haut volume comme la classification ou le résumé de texte. Les trois modèles sont accessibles via une tarification au jeton, avec les contrôles de sécurité et de gouvernance d'AWS, et leur usage compte dans les engagements de consommation AWS déjà souscrits par les entreprises. Sol est disponible dans les régions US East (Virginie du Nord) et US East (Ohio), tandis que Terra et Luna s'étendent également à US West (Oregon). L'accès se fait via l'API Responses compatible OpenAI, sur le point de terminaison bedrock-mantle, avec une authentification par jetons temporaires générés à partir des identifiants AWS classiques, évitant ainsi de stocker des secrets à long terme dans le code.

La nouveauté la plus significative de cette mise à jour est l'introduction du cache de prompt explicite, une fonctionnalité qui donne aux développeurs un contrôle précis sur les portions de leurs requêtes mises en cache et réutilisées d'un appel à l'autre. Le contenu mis en cache bénéficie d'une remise de 90 % sur la facturation et reste disponible pendant 30 minutes après sa création. Cette mécanique profite en particulier aux flux de travail agentiques, où les instructions système, les définitions d'outils et les documents de référence se répètent à l'identique sur de très nombreux appels successifs. Pour les entreprises qui opèrent des agents IA à grande échelle, cela représente une réduction directe et mesurable des coûts d'inférence, sans changement d'architecture applicative.

Ce lancement s'inscrit dans une stratégie plus large d'OpenAI visant à multiplier les canaux de distribution de ses modèles au-delà de sa propre API, en s'appuyant sur l'infrastructure cloud existante des entreprises. GPT-5.6 introduit aussi des niveaux de raisonnement ajustables, allant de none à xhigh, avec un réglage par défaut à medium : les niveaux plus élevés allouent davantage de ressources de raisonnement aux problèmes complexes, tandis que none privilégie la latence la plus faible pour les tâches simples. Pour les équipes migrant depuis GPT-5.5 ou GPT-5.4, OpenAI recommande de conserver dans un premier temps le niveau d'effort habituel, puis de tester un cran en dessous, GPT-5.6 étant plus efficient en jetons et capable de maintenir la qualité à un effort réduit sur de nombreuses charges de travail. Les paramètres d'échantillonnage classiques, température et top_p, ne restent réglables que lorsque l'effort de raisonnement est fixé à none.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

OpenAI GPT-5.6 Sol, Terra et Luna sont désormais disponibles sur Amazon Bedrock
1AWS ML Blog 

OpenAI GPT-5.6 Sol, Terra et Luna sont désormais disponibles sur Amazon Bedrock

OpenAI a annoncé la disponibilité générale de sa nouvelle famille de modèles GPT-5.6, baptisée Sol, Terra et Luna, sur Amazon Bedrock, le service d'inférence cloud d'AWS. Cette annonce marque un changement de nomenclature chez OpenAI : le chiffre 5.6 identifie la génération, tandis que les noms Sol, Terra et Luna désignent des niveaux de capacité distincts pouvant évoluer selon leur propre calendrier. Sol, le modèle phare de raisonnement, atteint un score record de 80 points sur l'index Artificial Analysis Coding Agent, soit 2,8 points de plus que le meilleur concurrent, tout en utilisant moins de la moitié des tokens de sortie, un temps d'exécution divisé par deux et un coût inférieur d'environ un tiers. Sur ExploitBench, un test dédié à la recherche en cybersécurité, Sol obtient 73,5%, contre 47,9% pour GPT-5.5 à budget de tokens comparable. Sur Agents' Last Exam, une évaluation portant sur des flux de travail professionnels de longue durée dans 55 domaines, Sol établit un nouveau record de 53,6, devançant son plus proche rival de 13,1 points. Terra, positionné comme le modèle équilibré pour la production quotidienne, surpasse GPT-5.5 à moindre coût, tandis que Luna cible les tâches à fort volume comme la classification ou le routage, où la latence et le coût par token priment. Les tarifs correspondent aux prix directs d'OpenAI et l'usage s'impute sur les engagements AWS existants des clients. Cette mise à disposition répond aux besoins d'entreprises qui déploient des agents autonomes sur des centaines d'étapes consécutives, que ce soit pour générer du code en production, mener des recherches sur des failles de sécurité ou analyser des séquences génétiques complètes. Ces charges de travail traitent souvent des données sensibles et exigent un débit stable même en cas de pics d'usage imprévisibles, dans des environnements où la résidence des données et la sécurité ne souffrent aucun compromis. En proposant trois niveaux de modèles aux performances et coûts différenciés, Amazon Bedrock permet aux équipes techniques d'ajuster précisément la puissance de calcul à chaque tâche, réduisant les dépenses inutiles sur les usages simples tout en réservant la puissance maximale aux problèmes complexes. Le nouveau moteur d'inférence d'Amazon Bedrock a été conçu pour absorber la nature imprévisible du trafic généré par les agents, où une seule requête utilisateur peut déclencher des centaines d'appels au modèle. Le système mutualise la capacité tout en isolant le débit de chaque client, et l'inférence reste cantonnée à la région AWS choisie pour répondre aux exigences réglementaires de résidence des données. Autre nouveauté clé : la mise en cache des prompts avec des points de rupture explicites, qui permet de réutiliser le contexte déjà traité, comme les instructions système ou les définitions d'outils, lors des appels suivants. Cette fonctionnalité vise directement les charges de travail agentiques et multi-étapes, où une grande partie du contexte se répète d'un appel à l'autre, réduisant ainsi coûts et latence pour les architectures d'intelligence artificielle les plus exigeantes.

💬 Ce qui m'accroche ici c'est pas les 80 points sur l'index de code, c'est le bond sur ExploitBench : 73,5% contre 47,9% pour GPT-5.5, sur un test taillé pour la recherche de failles de sécurité. Tu vois où ça mène : un modèle qui trouve mieux les vulnérabilités, ça sert la défense autant que l'attaque, et personne n'en parle vraiment. Le vrai coup, lui, c'est la distribution : atterrir sur Bedrock au prix OpenAI direct, c'est vendre la techno via la ligne AWS que les boîtes ont déjà signée, sans nouveau contrat à faire approuver.

LLMsActu
1 source
2MarkTechPost 

Guide de programmation complet pour exécuter les modèles open-weight GPT d'OpenAI avec des workflows d'inférence avancés

OpenAI a publié une version open-weight de ses modèles GPT sous l'identifiant openai/gpt-oss-20b, un modèle de 20 milliards de paramètres téléchargeable depuis HuggingFace et exécutable localement via la bibliothèque Transformers. Un guide technique détaillé, publié récemment, explique comment déployer ce modèle dans Google Colab en s'appuyant sur la quantification native MXFP4, les activations en torch.bfloat16, et le système devicemap="auto" pour l'allocation GPU automatique. Le modèle pèse environ 40 Go en téléchargement et nécessite au minimum 16 Go de VRAM, ce qui impose l'usage d'un GPU de type T4 ou A100, disponibles sur Colab Pro. Le tutoriel couvre l'installation des dépendances précises (Transformers 4.51+, accelerate, sentencepiece), le chargement du modèle avec trustremote_code=True, puis l'exécution de workflows complets : génération structurée, streaming, dialogue multi-tours, appel d'outils et inférence en batch. La mise à disposition de ce modèle en open-weight représente un changement significatif pour les développeurs et chercheurs qui souhaitent inspecter, modifier ou déployer un LLM de la famille GPT sans dépendre de l'API d'OpenAI. Contrairement aux modèles hébergés, gpt-oss-20b offre une transparence totale sur l'architecture, un contrôle complet des paramètres d'inférence (température, topp, longueur de séquence), et la possibilité d'exécution hors ligne sur infrastructure privée. Pour les entreprises soumises à des contraintes de confidentialité des données, ou pour les équipes de recherche qui ont besoin de reproductibilité, c'est une alternative concrète aux API fermées. Le guide recommande d'ailleurs les paramètres temperature=1.0 et topp=1.0 pour reproduire le comportement officiel du modèle. Ce mouvement s'inscrit dans une dynamique plus large de publication de modèles open-weight par les grands laboratoires : Meta avec Llama, Mistral AI avec ses modèles libres, ou encore Google avec Gemma. OpenAI, longtemps perçu comme le plus fermé des acteurs majeurs, adopte ici une stratégie différente en libérant un modèle intermédiaire techniquement capable. La compatibilité avec l'écosystème HuggingFace et Transformers facilite l'adoption immédiate par la communauté. Les prochaines étapes pourraient inclure des fine-tunings spécialisés par la communauté, des déploiements sur hardware grand public via des solutions comme llama.cpp ou Ollama, et une évaluation comparative approfondie face à Llama 3 ou Mistral Large, ce qui permettra de situer précisément gpt-oss-20b dans le paysage des modèles ouverts.

UELes équipes européennes soumises au RGPD peuvent désormais déployer un modèle de la famille GPT en infrastructure privée, sans transférer de données vers les serveurs d'OpenAI.

💬 OpenAI qui lâche un open-weight, ça faisait longtemps qu'on en parlait sans y croire. 20 milliards de paramètres, compatible HuggingFace, déployable sur ta propre infra, c'est exactement ce que réclamaient les équipes sous RGPD depuis des mois. Reste à voir si ça tient face à Llama 3 une fois les benchmarks sérieux posés.

LLMsTuto
1 source
Les modèles Gemma 4 arrivent sur Amazon Bedrock
3AWS ML Blog 

Les modèles Gemma 4 arrivent sur Amazon Bedrock

Amazon Web Services vient d'annoncer la disponibilité de la famille Gemma 4 sur Amazon Bedrock, le service managé de modèles d'intelligence artificielle du géant du cloud. Développés par Google DeepMind et publiés sous licence Apache 2.0, ces modèles open-weight sont déclinés en trois variantes : Gemma 4 31B, un modèle dense de 30,7 milliards de paramètres ; Gemma 4 26B-A4B, une architecture de type mixture-of-experts (MoE) avec seulement 3,8 milliards de paramètres actifs par requête sur 25,2 milliards au total ; et Gemma 4 E2B, un modèle compact de 2,3 milliards de paramètres effectifs. Tous supportent une fenêtre de contexte de 256 000 tokens (128 000 pour le modèle compact), un mode de raisonnement intégré, l'appel natif de fonctions pour les workflows agentiques, et des entrées multimodales combinant texte et image. Selon Artificial Analysis, le modèle Gemma 4 31B affiche un Intelligence Index de 39, soit bien au-dessus de la médiane de 15 pour la catégorie des modèles open-weight entre 4 et 40 milliards de paramètres. L'intégration de Gemma 4 dans Bedrock répond à une tension bien connue des entreprises adoptant des modèles open-weight en production : accéder aux meilleurs modèles disponibles tout en maintenant un contrôle total sur leurs données, leur conformité réglementaire et leur infrastructure. Disponibles via trois niveaux de service (Standard, Priority et Flex), ces modèles s'exécutent entièrement sur l'infrastructure AWS, sans que les prompts ou les réponses ne soient utilisés pour entraîner d'autres modèles ni partagés avec des tiers. Les équipes peuvent ainsi construire des agents multimodaux, des pipelines de traitement documentaire ou des assistants au développement logiciel, avec une prise en charge native de plus de 35 langues et un pré-entraînement sur plus de 140 langues. Cette annonce s'inscrit dans la compétition croissante entre les fournisseurs cloud pour proposer les meilleurs modèles open-weight sur leurs plateformes managées, en rivalité directe avec Microsoft Azure et Google Cloud. Google DeepMind continue de déployer la gamme Gemma comme levier stratégique pour étendre son influence dans l'écosystème IA sans passer uniquement par son propre cloud. Pour AWS, distribuer Gemma 4 sur Bedrock renforce son catalogue de modèles fondateurs sans investissement en R&D propre, tout en captant les entreprises qui préfèrent la flexibilité open-weight à des modèles propriétaires comme Claude ou Titan. La nature open-weight de la famille Gemma permet en outre aux organisations d'auditer l'architecture, de benchmarker sur leurs propres données et de fine-tuner les modèles selon leurs besoins, une capacité que les modèles fermés n'offrent pas.

UELes entreprises européennes sur AWS peuvent désormais déployer Gemma 4 avec des garanties de conformité RGPD, les prompts n'étant ni utilisés pour l'entraînement ni partagés avec des tiers.

LLMsOpinion
1 source
Le réglage fin des modèles Amazon Nova pour une extraction précise des données d'e-mails
4AWS ML Blog 

Le réglage fin des modèles Amazon Nova pour une extraction précise des données d'e-mails

Parcel Perform, plateforme d'expérience de livraison basée sur l'IA destinée aux entreprises d'ecommerce, a collaboré avec le AWS Generative AI Innovation Center (GenAIIC) pour résoudre un problème concret : extraire des données structurées à partir d'emails aux formats très divers, des simples notifications aux documents HTML complexes truffés d'éléments JavaScript. L'équipe a utilisé Amazon SageMaker AI pour affiner par fine-tuning les modèles Amazon Nova Micro et Nova Lite, en s'appuyant sur l'apprentissage supervisé (SFT) combiné à la technique PEFT (Parameter-Efficient Fine-Tuning) via LoRA (Low-Rank Adaptation), une méthode qui permet de personnaliser un modèle avec peu de données d'entraînement tout en limitant les ressources de calcul nécessaires. Selon Le Vy, responsable de l'équipe IA chez Parcel Perform, le modèle Nova Micro ainsi spécialisé a atteint jusqu'à 94,77 % de précision d'extraction sur le jeu de données de test, soit une amélioration de 16,6 points de pourcentage par rapport au modèle de référence, tout en réduisant la latence d'inférence de plus de 30 % et en divisant les coûts par deux par rapport à la solution précédemment utilisée par l'entreprise. Ces gains ne sont pas anecdotiques pour une entreprise qui traite des millions de messages email par jour : les modèles génériques peinaient à distinguer des champs proches comme les numéros de commande et les numéros de suivi, produisaient des hallucinations, et le traitement d'emails au format HTML faisait exploser les coûts en tokens. En apprenant au modèle à reconnaître les schémas de données propres à Parcel Perform, le fine-tuning a permis de résoudre simultanément trois problèmes distincts, la précision, la latence et le coût, ce qui est rare puisque ces métriques s'améliorent rarement de concert. Résultat concret : la version optimisée de Nova Micro égale ou dépasse les performances de Nova Lite tout en coûtant moins cher, ce qui a permis à Parcel Perform de déployer la solution en production pour ses opérations logistiques. Sur le plan technique, le workflow repose sur la préparation de données d'entraînement au format de conversation Amazon Bedrock, associant le contenu d'un email aux entités à en extraire, hébergées sur Amazon S3 avant le lancement du job de fine-tuning sur SageMaker AI à l'aide d'une configuration LoRA. Le modèle final est ensuite déployé sur Amazon Bedrock en inférence à la demande, facturée au token. Ce projet illustre une tendance plus large chez AWS : pousser les entreprises à personnaliser des modèles de taille réduite, via des "recettes" Nova au format YAML qui standardisent les hyperparamètres d'entraînement, plutôt que de s'appuyer sur des modèles génériques massifs, jugés plus coûteux et moins précis sur des tâches d'extraction très spécifiques au métier.

LLMsTuto
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic