OpenAI transforme GPT-5.6 en fusée… réservée à quelques privilégiés
OpenAI a dévoilé le 13 août 2026 un nouveau mode baptisé Ultrafast pour son modèle le plus avancé, GPT-5.6 Sol, capable de générer jusqu'à 750 tokens par seconde, soit un débit jusqu'à 14 fois supérieur au traitement Standard. Concrètement, une réponse de 1 500 tokens pourrait théoriquement être produite en deux secondes, hors temps de réflexion initial et variations liées à la charge du système. Cette accélération repose sur un partenariat avec Cerebras, le rival de Nvidia connu pour ses puces géantes de type Wafer-Scale Engine, qui embarquent 44 gigaoctets de mémoire SRAM permettant de garder les poids du modèle au plus près du calcul et de limiter les allers-retours avec une mémoire externe plus lente. Cerebras revendique par ailleurs un gain de 5,6 fois de bout en bout sur le benchmark professionnel GDP-Val, sans perte de qualité mesurée, même si ces chiffres proviennent de tests internes à l'entreprise et non d'une évaluation indépendante. Pour l'instant, Ultrafast n'est disponible qu'en preview limitée dans l'API OpenAI, réservée à un petit groupe d'entreprises triées sur le volet, les autres clients ne pouvant que s'inscrire pour être notifiés d'une éventuelle ouverture future. Aucun prix n'a encore été communiqué.
Résumé et traduction réalisés par Le Fil IA à partir de Le Big Data. Lire l'article original →
Cette avancée dépasse le simple confort d'utilisation : elle vise directement les systèmes d'agents IA, dont l'efficacité dépend fortement de la latence cumulée sur des tâches complexes. Un agent qui doit lire des journaux techniques, interroger plusieurs outils, vérifier une hypothèse puis recommencer accumule des temps d'attente à chaque étape. Avec un débit dix fois supérieur, une chaîne d'agents comportant une douzaine d'étapes redeviendrait exploitable en quasi temps réel, avec plusieurs réponses candidates, des boucles de vérification et une passe de relecture critique avant restitution finale. Selon Raphaël Vuillier, fondateur et CEO de StackEasy, cité par le média, la latence n'est plus un simple critère de confort mais une contrainte d'architecture pour ces systèmes. Les secteurs cités par OpenAI comme premiers bénéficiaires sont la réponse à incident technique, la recherche financière, le support vocal et le commerce, autant de domaines où chaque seconde de traitement a une valeur mesurable.
Le lancement d'Ultrafast intervient seulement quelques semaines après l'ouverture de GPT-5.6 au grand public, ce qui accentue le contraste entre une promesse de vitesse spectaculaire et un accès encore très restreint. OpenAI indique déjà tester le service en interne sur ses propres incidents techniques, où des ingénieurs font analyser des journaux et des traces par le modèle pour synthétiser des conversations et préparer des correctifs, la décision finale restant humaine. Le mode Fast existant, plafonné à 2,5 fois la vitesse standard pour un coût doublé, illustre le saut d'échelle que représente Ultrafast. La question désormais posée est celle du calendrier d'ouverture à davantage de clients et du positionnement tarifaire de cette offre, dans un marché où la rapidité d'inférence devient un argument concurrentiel aussi stratégique que la qualité brute des réponses générées.
Les entreprises europeennes clientes de l'API OpenAI pourraient a terme beneficier d'Ultrafast pour leurs systemes d'agents, mais l'acces reste reserve a un petit groupe d'entreprises triees sur le volet et aucun acteur francais ou europeen n'est cite.