Aller au contenu principal
LLMs · Outil ·

Introduction de la mise en cache explicite des prompts pour les modèles GPT-5.6 d'OpenAI sur Amazon Bedrock

OpenAI et Amazon Web Services ont annoncé la disponibilité générale de trois nouveaux modèles sur Amazon Bedrock : GPT-5.6 Sol, Terra et Luna. Coécrite avec Chris Dickens, ingénieur chez OpenAI, cette annonce introduit une famille segmentée en trois niveaux de capacité : Sol, taillé pour le raisonnement complexe et le codage agentique, Terra, pensé pour les charges de production quotidiennes équilibrées, et Luna, optimisé pour les tâches rapides à haut volume comme la classification ou le résumé de texte. Les trois modèles sont accessibles via une tarification au jeton, avec les contrôles de sécurité et de gouvernance d'AWS, et leur usage compte dans les engagements de consommation AWS déjà souscrits par les entreprises. Sol est disponible dans les régions US East (Virginie du Nord) et US East (Ohio), tandis que Terra et Luna s'étendent également à US West (Oregon). L'accès se fait via l'API Responses compatible OpenAI, sur le point de terminaison bedrock-mantle, avec une authentification par jetons temporaires générés à partir des identifiants AWS classiques, évitant ainsi de stocker des secrets à long terme dans le code.

2 min de lecturePertinence 38
Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

La nouveauté la plus significative de cette mise à jour est l'introduction du cache de prompt explicite, une fonctionnalité qui donne aux développeurs un contrôle précis sur les portions de leurs requêtes mises en cache et réutilisées d'un appel à l'autre. Le contenu mis en cache bénéficie d'une remise de 90 % sur la facturation et reste disponible pendant 30 minutes après sa création. Cette mécanique profite en particulier aux flux de travail agentiques, où les instructions système, les définitions d'outils et les documents de référence se répètent à l'identique sur de très nombreux appels successifs. Pour les entreprises qui opèrent des agents IA à grande échelle, cela représente une réduction directe et mesurable des coûts d'inférence, sans changement d'architecture applicative.

Ce lancement s'inscrit dans une stratégie plus large d'OpenAI visant à multiplier les canaux de distribution de ses modèles au-delà de sa propre API, en s'appuyant sur l'infrastructure cloud existante des entreprises. GPT-5.6 introduit aussi des niveaux de raisonnement ajustables, allant de none à xhigh, avec un réglage par défaut à medium : les niveaux plus élevés allouent davantage de ressources de raisonnement aux problèmes complexes, tandis que none privilégie la latence la plus faible pour les tâches simples. Pour les équipes migrant depuis GPT-5.5 ou GPT-5.4, OpenAI recommande de conserver dans un premier temps le niveau d'effort habituel, puis de tester un cran en dessous, GPT-5.6 étant plus efficient en jetons et capable de maintenir la qualité à un effort réduit sur de nombreuses charges de travail. Les paramètres d'échantillonnage classiques, température et top_p, ne restent réglables que lorsque l'effort de raisonnement est fixé à none.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Sur le papier, c'est de la plomberie, mais c'est le genre de plomberie qui compte vraiment quand tu fais tourner des agents à grande échelle. Une remise de 90% sur les tokens répétés (instructions système, définitions d'outils), ça change le calcul économique de tout workflow agentique qui appelle le même contexte des centaines de fois par heure. Et le vrai signal, c'est qu'OpenAI arrête de miser uniquement sur sa propre API : distribuer ses modèles via l'infra AWS des entreprises, c'est admettre que le canal de vente compte autant que le modèle lui-même.

À lire ensuite

01OpenAI GPT-5.6 Sol, Terra et Luna sont désormais disponibles sur Amazon Bedrock47AWS ML BlogLLMs 02Guide de programmation complet pour exécuter les modèles open-weight GPT d'OpenAI avec des workflows d'inférence avancés52MarkTechPostLLMs 03Les modèles Gemma 4 arrivent sur Amazon Bedrock44AWS ML BlogLLMs 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.