Introduction de la mise en cache explicite des prompts pour les modèles GPT-5.6 d'OpenAI sur Amazon Bedrock
OpenAI et Amazon Web Services ont annoncé la disponibilité générale de trois nouveaux modèles sur Amazon Bedrock : GPT-5.6 Sol, Terra et Luna. Coécrite avec Chris Dickens, ingénieur chez OpenAI, cette annonce introduit une famille segmentée en trois niveaux de capacité : Sol, taillé pour le raisonnement complexe et le codage agentique, Terra, pensé pour les charges de production quotidiennes équilibrées, et Luna, optimisé pour les tâches rapides à haut volume comme la classification ou le résumé de texte. Les trois modèles sont accessibles via une tarification au jeton, avec les contrôles de sécurité et de gouvernance d'AWS, et leur usage compte dans les engagements de consommation AWS déjà souscrits par les entreprises. Sol est disponible dans les régions US East (Virginie du Nord) et US East (Ohio), tandis que Terra et Luna s'étendent également à US West (Oregon). L'accès se fait via l'API Responses compatible OpenAI, sur le point de terminaison bedrock-mantle, avec une authentification par jetons temporaires générés à partir des identifiants AWS classiques, évitant ainsi de stocker des secrets à long terme dans le code.
La nouveauté la plus significative de cette mise à jour est l'introduction du cache de prompt explicite, une fonctionnalité qui donne aux développeurs un contrôle précis sur les portions de leurs requêtes mises en cache et réutilisées d'un appel à l'autre. Le contenu mis en cache bénéficie d'une remise de 90 % sur la facturation et reste disponible pendant 30 minutes après sa création. Cette mécanique profite en particulier aux flux de travail agentiques, où les instructions système, les définitions d'outils et les documents de référence se répètent à l'identique sur de très nombreux appels successifs. Pour les entreprises qui opèrent des agents IA à grande échelle, cela représente une réduction directe et mesurable des coûts d'inférence, sans changement d'architecture applicative.
Ce lancement s'inscrit dans une stratégie plus large d'OpenAI visant à multiplier les canaux de distribution de ses modèles au-delà de sa propre API, en s'appuyant sur l'infrastructure cloud existante des entreprises. GPT-5.6 introduit aussi des niveaux de raisonnement ajustables, allant de none à xhigh, avec un réglage par défaut à medium : les niveaux plus élevés allouent davantage de ressources de raisonnement aux problèmes complexes, tandis que none privilégie la latence la plus faible pour les tâches simples. Pour les équipes migrant depuis GPT-5.5 ou GPT-5.4, OpenAI recommande de conserver dans un premier temps le niveau d'effort habituel, puis de tester un cran en dessous, GPT-5.6 étant plus efficient en jetons et capable de maintenir la qualité à un effort réduit sur de nombreuses charges de travail. Les paramètres d'échantillonnage classiques, température et top_p, ne restent réglables que lorsque l'effort de raisonnement est fixé à none.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



