SpaceXAI lance Grok Voice Transcribe 2.0 : transcription vocale 2x plus précise, à 0,10 $/heure
SpaceXAI a lancé le 19 septembre 2026 Grok Voice Transcribe 2.0, sa nouvelle génération de modèle de reconnaissance vocale (speech-to-text). L'entreprise affirme que ce modèle est deux fois plus précis que la version 1.0, au même tarif : 0,10 dollar par heure d'audio en mode batch et 0,20 dollar par heure en streaming, soit environ 1,67 et 3,33 dollars pour 1 000 minutes. Le modèle, identifié sous le nom grok-voice-transcribe-2.0, est disponible dès aujourd'hui via l'API Speech to Text, en mode batch (fichiers jusqu'à 500 Mo, douze formats audio pris en charge) et en streaming via WebSocket. Aucune ouverture des poids du modèle n'a été annoncée, ce qui exclut tout hébergement local. Sur le classement public Artificial Analysis (benchmark AA-WER Streaming), SpaceXAI revendique la première place parmi 32 modèles de transcription en streaming testés.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Ce lancement cible spécifiquement les audios difficiles à transcrire : appels téléphoniques bruyants, voix qui se chevauchent, accents régionaux et données sensibles dictées à l'oral comme des numéros de téléphone ou des adresses email. Sur des jeux de données internes issus de trafic réel, la version 2.0 améliore ses résultats sur les quatre catégories testées par SpaceXAI, avec une avancée particulièrement marquée sur les phrases courtes multilingues, comme les commandes vocales dans un véhicule : le taux d'erreur passe de 20,6 % à 6,8 %, soit environ 67 % d'erreurs de mots en moins. Le modèle détecte automatiquement la langue parlée et suit les changements de langue en cours d'enregistrement. Parmi les fonctionnalités incluses sans surcoût figurent l'identification des locuteurs (diarisation), l'horodatage au mot près avec score de confiance, la transcription simultanée de huit canaux audio, la suppression automatique des hésitations orales, et un système de détection de fin de tour de parole destiné aux agents vocaux. Atlassian a déjà intégré ce modèle dans son outil Loom pour transcrire l'ensemble de ses vidéos, jugeant les résultats plus précis que sa solution précédente.
Grok Voice Transcribe 2.0 s'appuie sur le modèle audio qui alimente déjà l'assistant vocal Grok, utilisé selon SpaceXAI pour des dizaines de milliers d'appels de support client par jour, la transcription de millions d'heures de vidéos, ainsi que le système embarqué des véhicules Tesla. L'entraînement s'appuie sur des données audio réelles, bruyantes et multilingues, affinées ensuite par post-entraînement. Il convient de noter que les résultats internes communiqués par SpaceXAI n'ont pas été vérifiés de façon indépendante. Ce lancement illustre la concurrence croissante sur le marché des API de transcription vocale, où la précision sur des conditions audio réalistes, plutôt que sur des enregistrements de studio, devient un argument commercial central pour les entreprises technologiques.
Les entreprises françaises et européennes de support client ou de transcription peuvent tester cette API, mais aucun acteur ou régulation français/européen n'est directement concerné.