Aller au contenu principal
Découvrez gpt-realtime et les mises à jour de l'API en temps réel
OutilsOpenAI Blog · 1 min de lecture

Découvrez gpt-realtime et les mises à jour de l'API en temps réel

Source originale ↗·

Nous présentons gpt-realtime, un modèle de traitement du langage parlant plus avancé, ainsi que de nouvelles capacités d'API, notamment le support du serveur MCP, l'entrée d'image et le support d'appels téléphoniques SIP.

Impact France/UE

Aucun impact direct - Le modèle gpt-realtime et ses mises à jour d'API ne sont pas spécifiques à des entreprises françaises ou européennes, ne ciblent pas de lois particulières (comme l'AI Act ou le RGPD), et n'ont pas d'effet immédiat sur des secteurs spécifiques en France ou dans l'UE.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Gradium lance stt-translate et s2s-translate, des modèles de traduction vocale en temps réel plus précis et plus rapides que gpt-realtime-translate
1MarkTechPost 

Gradium lance stt-translate et s2s-translate, des modèles de traduction vocale en temps réel plus précis et plus rapides que gpt-realtime-translate

Gradium a lancé ce jeudi deux modèles de traduction vocale en temps réel, baptisés stt-translate et s2s-translate, qui s'attaquent directement aux offres de Google et d'OpenAI sur ce marché en pleine expansion. Les deux modèles couvrent cinq langues, anglais, français, allemand, espagnol et portugais, soit vingt paires de traduction dans toutes les directions. stt-translate convertit la parole d'une langue en texte dans une autre en un seul passage, sans transcription intermédiaire, en s'appuyant sur le cadre Hibiki-Zero et un entraînement par apprentissage par renforcement optimisant simultanément la précision et la latence. s2s-translate va plus loin en produisant directement de l'audio traduit depuis de l'audio source, en enchaînant stt-translate avec un modèle TTS de Gradium au sein d'un service unique accessible via WebSocket duplex. La latence moyenne annoncée est de 3,0 secondes, et les flux audio sont gérés en PCM 24 kHz en entrée et 48 kHz en sortie, avec support WAV, Opus, mu-law et A-law. Sur le plan des performances, Gradium affirme surpasser gpt-realtime-translate d'OpenAI sur le score BLEU, la métrique historique de traduction automatique mesurant la fidélité lexicale, tout en étant comparable sur MetricX, le système d'évaluation neuronal de Google qui juge la qualité sémantique selon des critères proches du jugement humain. Face à gemini-3.5-live-translate de Google, Gradium l'emporte sur les deux métriques. La latence de 3,0 secondes se situe devant OpenAI (3,6 s) mais légèrement derrière Gemini (2,9 s), un écart marginal. La différenciation la plus concrète réside dans la flexibilité vocale : Gradium permet de choisir une voix dans un catalogue ou de cloner sa propre voix pour la sortie audio, une fonctionnalité absente chez gpt-realtime-translate et non précisée chez Gemini. Ces modèles s'inscrivent dans une course accélérée à la traduction vocale temps réel, portée par des cas d'usage comme les réunions internationales, le service client multilingue et l'accessibilité. L'approche de Gradium, fusionner transcription et traduction en un seul modèle plutôt qu'enchaîner trois systèmes distincts, réduit la complexité d'intégration et les points de latence. C'est précisément le type d'architecture que les développeurs cherchent pour éviter de gérer plusieurs API et connexions en parallèle. En proposant ces modèles via une interface WebSocket unique avec streaming des résultats, Gradium vise les équipes produit qui construisent des expériences vocales multilingues sans vouloir assembler elles-mêmes une pipeline STT-MT-TTS. Le lancement positionne la startup face à deux des acteurs les plus capitalisés du secteur, avec des résultats de benchmarks qui, s'ils se confirment en production, pourraient en faire un concurrent sérieux sur ce segment.

UELes développeurs européens construisant des applications vocales multilingues peuvent intégrer directement ces modèles via WebSocket, le français et l'allemand étant inclus parmi les cinq langues supportées dès le lancement.

OutilsOpinion
1 source
OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour des agents vocaux a faible latence dans l'API
2MarkTechPost 

OpenAI lance GPT-Realtime-2.1 et GPT-Realtime-2.1-mini pour des agents vocaux a faible latence dans l'API

OpenAI a annoncé le lancement de deux nouveaux modèles dans son API Realtime, baptisés gpt-realtime-2.1 et gpt-realtime-2.1-mini, conçus pour les agents vocaux à faible latence. La version mini constitue la nouveauté la plus notable : il s'agit d'un modèle de raisonnement miniature dédié à la voix en temps réel, capable de traiter des entrées audio et texte via une connexion live, et facturé au même tarif que l'ancien gpt-realtime-mini. OpenAI a par ailleurs réduit la latence p95, c'est-à-dire le temps de réponse au 95e percentile qui capture les cas les plus lents, d'au moins 25% sur l'ensemble des modèles vocaux Realtime, grâce à un système de mise en cache amélioré. Le modèle plus complet, gpt-realtime-2.1, apporte de son côté une meilleure reconnaissance alphanumérique, une gestion plus fine du silence et du bruit, ainsi qu'un traitement amélioré des interruptions, tout en conservant le support de la voix à voix avec un niveau de raisonnement configurable, le suivi d'instructions et l'appel de fonctions. Cette capacité de raisonnement change concrètement le comportement des agents vocaux. Jusqu'ici, un agent qui déclenchait un appel de fonction restait souvent silencieux le temps de l'exécution, ce qui poussait l'utilisateur à croire que la conversation avait été coupée et à interrompre l'échange. Avec le raisonnement, le modèle peut désormais annoncer son action, par exemple "je vérifie votre commande maintenant", avant de l'exécuter, ce qui maintient la cohérence des tâches vocales à plusieurs étapes. Ce niveau de raisonnement est ajustable sur cinq paliers (minimal, low, medium, high, xhigh), le niveau low étant recommandé par défaut pour limiter la latence dans la plupart des usages en production. La mise en cache profite aussi directement aux coûts : pour gpt-realtime-2.1-mini, l'audio en entrée mis en cache tombe à 0,30 dollar par million de tokens contre 10 dollars pour de l'audio non caché, un écart qui profite surtout aux sessions longues où l'invite système reste en cache après le premier tour. Cette évolution s'inscrit dans la logique de l'API Realtime d'OpenAI, qui traite et génère l'audio via un seul modèle plutôt que d'enchaîner des systèmes séparés de reconnaissance et de synthèse vocale, réduisant la latence tout en préservant les nuances de la parole. Sur le plan tarifaire, l'écart entre les deux modèles reste marqué : la sortie audio de gpt-realtime-2.1-mini coûte 20 dollars par million de tokens contre 64 dollars pour la version complète, soit un rapport de près de trois, laissant aux équipes de développement le choix d'arbitrer entre performance et coût selon leurs besoins, dans un marché des agents vocaux IA en pleine intensification.

OutilsActu
1 source
DLSS 5 ressemble à un filtre IA génératif en temps réel pour les jeux vidéo
3The Verge AI 

DLSS 5 ressemble à un filtre IA génératif en temps réel pour les jeux vidéo

Nvidia a officiellement dévoilé DLSS 5 lors de sa conférence GTC, marquant un tournant majeur dans l'histoire de la technologie de rendu graphique pour les jeux vidéo. Contrairement aux versions précédentes, cette mise à jour intègre une composante d'IA générative en temps réel, capable de réécrire l'image affichée à l'écran plutôt que de simplement l'améliorer. L'enjeu est considérable pour l'industrie du jeu vidéo : là où DLSS 4 et ses prédécesseurs utilisaient l'apprentissage automatique pour combler les lacunes entre une résolution native et une résolution upscalée, DLSS 5 franchit une nouvelle étape en générant activement des éléments visuels, lumières, ombres, détails, qui n'existaient pas dans le rendu original. Cela soulève des questions fondamentales sur la fidélité artistique et le contrôle créatif des développeurs. Le PDG de Nvidia, Jensen Huang, a qualifié cette annonce de "moment GPT pour le graphisme", en insistant sur la capacité à "mêler le rendu artisanal à l'IA générative pour un bond spectaculaire en réalisme visuel". Mais les premières réactions de la communauté sont partagées : plusieurs observateurs critiquent une technologie jugée trop interventionniste, qualifiant le résultat de "slop", terme anglais désignant un contenu généré sans soin, qui altèrerait de façon inacceptable les intentions artistiques des créateurs de jeux. Le débat qui s'ouvre autour de DLSS 5 dépasse la simple question de performance technique : il interroge la place de l'IA générative dans des œuvres dont l'esthétique visuelle est pensée et maîtrisée par des artistes. L'adoption de cette technologie dépendra largement de la capacité de Nvidia à rassurer les studios sur leur niveau de contrôle et à démontrer que l'IA peut amplifier, sans trahir, leur vision créative.

OutilsOutil
1 source
Obtenez plus de contexte et comprenez les traductions plus en profondeur grâce aux mises à jour alimentées par l'IA dans Traduire.
4Google AI Blog 

Obtenez plus de contexte et comprenez les traductions plus en profondeur grâce aux mises à jour alimentées par l'IA dans Traduire.

Les mises à jour alimentées par l'IA améliorent la fonctionnalité de Traduire, offrant un contexte plus complet et des traductions plus approfondies.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic