Aller au contenu principal
IA : Thinking Machines présente un modèle qui réagit en direct à ce qu’on lui raconte
LLMsNext INpact · 2 min de lecture

IA : Thinking Machines présente un modèle qui réagit en direct à ce qu’on lui raconte

Source originale ↗·
IA : Thinking Machines présente un modèle qui réagit en direct à ce qu’on lui raconte
▶ Voir sur YouTube

Thinking Machines Lab, la start-up fondée par Mira Murati, ancienne directrice technique d'OpenAI, a présenté le 11 mai 2026 son modèle TLM-Interaction-Small, qu'elle qualifie de « modèle interactif ». Contrairement aux IA génératives classiques qui suspendent tout traitement le temps de formuler une réponse, ce système fonctionne en mode « full duplex » : il peut écouter, répondre et participer à une conversation en parallèle, avec un temps de latence de seulement 0,40 seconde, soit un rythme très proche d'un échange humain naturel. Parmi les capacités démontrées figurent la traduction instantanée de l'hindi vers l'anglais, l'adaptation stylistique d'un discours familier vers un registre professionnel, la recherche d'informations en cours de conversation, ou encore la réaction à des éléments visuels captés par caméra, comme détecter une mauvaise posture ou signaler une baisse de concentration.

Ce type de modèle cherche à combler ce que Thinking Machines Lab appelle le « goulet d'étranglement de la collaboration » des IA actuelles : leur incapacité à rester présentes et réactives pendant qu'elles calculent. L'enjeu est de rendre l'interaction homme-machine plus fluide et naturelle, ce qui ouvre des perspectives concrètes pour des usages professionnels temps réel, comme l'assistance lors de réunions, la traduction simultanée ou le coaching comportemental en direct. Pour les utilisateurs et les entreprises, cela représente un changement qualitatif potentiellement significatif par rapport aux interfaces actuelles de type chatbot, où chaque échange reste fondamentalement séquentiel et coupé du contexte environnant.

La start-up a été fondée en février 2025 et a levé 2 milliards de dollars dès juin de la même année, mais elle a depuis subi des départs importants : plusieurs employés ont été recrutés par Meta début 2026, et trois autres sont retournés chez OpenAI. Ces turbulences n'ont pas empêché l'avancement du projet. TLM-Interaction-Small n'est pas encore accessible au public : une préversion de recherche est attendue dans les prochains mois, et une sortie plus large est prévue plus tard en 2026. Le modèle s'inscrit dans une tendance plus large qui voit plusieurs acteurs chercher à dépasser les limites des IA génératives traditionnelles. Il se situe entre ces dernières et les ambitions des « world models », comme ceux qu'AMI Labs, co-fondée par Yann LeCun, Laurent Solly et Alexandre Lebrun, cherche à construire pour ancrer l'IA dans la compréhension du monde physique. Reste à voir si le produit final, une fois déployé, sera à la hauteur des benchmarks encourageants déjà publiés.

Impact France/UE

L'avènement des modèles full duplex ouvre une compétition directe avec des initiatives comme AMI Labs, co-fondée par des entrepreneurs français (Alexandre Lebrun, Laurent Solly), qui développent leurs propres modèles interactifs ancrés dans la compréhension du monde physique.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Thinking Machines présente des modèles d'interaction pour des conversations vocales et vidéo en quasi-temps réel
1VentureBeat AI 

Thinking Machines présente des modèles d'interaction pour des conversations vocales et vidéo en quasi-temps réel

Thinking Machines, la startup d'intelligence artificielle fondée par Mira Murati, ex-directrice technique d'OpenAI, et John Schulman, co-fondateur et ancien chercheur de la même entreprise, a dévoilé cette semaine un aperçu de recherche de ce qu'elle appelle des "modèles d'interaction", une nouvelle catégorie de systèmes multimodaux natifs conçus pour répondre en quasi-temps réel. Le modèle présenté, TML-Interaction-Small, repose sur une architecture de type Mixture-of-Experts (MoE) de 276 milliards de paramètres, dont seulement 12 milliards sont actifs simultanément. Il traite des blocs d'entrée et de sortie de 200 millisecondes en parallèle, ce qu'on appelle le "full duplex", permettant au système d'écouter, de parler et de voir en même temps. La startup précise qu'un aperçu limité sera ouvert dans les prochains mois pour collecter des retours, suivi d'une mise à disposition plus large d'ici la fin de l'année. Ce que Thinking Machines cherche à résoudre est un problème structurel de tous les grands modèles actuels : leur incapacité à fonctionner autrement qu'en mode "tour par tour", où l'IA attend que l'utilisateur ait terminé avant de commencer à traiter, puis se fige pendant qu'elle génère une réponse. Cette contrainte force les utilisateurs à reformuler leurs pensées comme des emails, à tout regrouper en une seule requête. Avec une architecture "full duplex", le modèle peut interrompre naturellement, réagir à un signal visuel comme un bug dans un extrait de code, ou accueillir un interlocuteur qui entre dans le champ d'une vidéo, des comportements qui rendent l'interaction beaucoup plus proche d'une conversation humaine réelle. Les résultats sur les benchmarks tiers contre les modèles d'interaction rapide des autres grands laboratoires sont décrits comme convaincants, même si les détails précis restent à paraître. Techniquement, le système s'écarte des pipelines conventionnels en abandonnant les encodeurs audio massifs comme Whisper au profit d'une fusion précoce sans encodeur, ingérant directement les signaux audio bruts sous forme dMel et des patches d'image de 40x40 pixels via une couche d'embedding légère, le tout co-entraîné au sein du transformer. Le système repose sur deux composants distincts : un "modèle d'interaction" qui gère le dialogue en continu, et un "modèle de fond" asynchrone chargé des raisonnements prolongés, de la navigation web ou des appels d'outils complexes, dont les résultats sont réintégrés fluidement dans la conversation. Thinking Machines s'inscrit dans une course qui voit OpenAI, Google et d'autres investir massivement dans les modèles temps réel depuis 2024, mais revendique une approche architecturale de premier niveau plutôt qu'un simple habillage logiciel, un pari technologique dont la portée réelle ne sera mesurable qu'à l'ouverture du preview public.

LLMsOpinion
1 source
Thinking Machines Lab lance son premier modèle et juge qu'OpenAI rate la voix faute d'interactivité
2The Decoder 

Thinking Machines Lab lance son premier modèle et juge qu'OpenAI rate la voix faute d'interactivité

Thinking Machines Lab, la start-up fondée par Mira Murati, ex-directrice technique d'OpenAI, a présenté son premier modèle d'intelligence artificielle multimodal. Le système traite simultanément de l'audio, de la vidéo et du texte en segments de 200 millisecondes, une architecture conçue pour produire des échanges vocaux quasi instantanés. La société positionne ce modèle comme un concurrent direct de GPT Realtime 2 d'OpenAI et de Gemini Live de Google, les deux références actuelles du marché de l'IA vocale en temps réel. L'argument central de Thinking Machines Lab est que l'IA vocale dominante souffre d'une limite fondamentale : elle reproduit un schéma questions-réponses, là où une vraie conversation humaine est fluide, interrompible, et non séquentielle. En traitant les flux en parallèle plutôt qu'en série, le modèle vise à permettre des interactions plus naturelles, où l'on peut couper la parole, nuancer ou rebondir sans attendre la fin d'une réponse. Pour les professionnels, assistants vocaux, interfaces client ou outils de collaboration, ce gain qualitatif représente un saut d'usage concret. Mira Murati a quitté OpenAI en septembre 2024 après plusieurs années à la tête de la direction technique, ayant piloté le lancement de ChatGPT et GPT-4. Thinking Machines Lab a depuis levé des fonds significatifs et réuni plusieurs anciens cadres d'OpenAI. La course à l'IA vocale interactive s'accélère, avec des enjeux majeurs sur les interfaces du futur : le modèle qui s'imposera comme le plus naturel aura un avantage décisif dans l'adoption grand public et enterprise.

LLMsOpinion
1 source
☕️ Thinking Machines publie Inkling, un modèle généraliste à poids ouverts
3Next INpact 

☕️ Thinking Machines publie Inkling, un modèle généraliste à poids ouverts

Le laboratoire Thinking Machines, fondé par Mira Murati, ancienne directrice technique d'OpenAI, a dévoilé mercredi 15 juillet son premier modèle à poids ouverts, baptisé Inkling. L'annonce intervient dix huit mois après une levée de fonds record de 2 milliards de dollars pour l'entreprise. Inkling repose sur une architecture Mixture of Experts totalisant 975 milliards de paramètres, dont seulement 41 milliards sont activés à chaque requête, une conception pensée pour limiter les coûts de calcul tout en conservant une large capacité de connaissances. Le modèle gère une fenêtre de contexte pouvant atteindre 1 million de tokens et a été entraîné sur 45 000 milliards de tokens couvrant texte, images, audio et vidéo. Thinking Machines propose également une version allégée, Inkling Small, dotée de 12 milliards de paramètres actifs et entraînée selon la même méthode. Les deux modèles sont accessibles dès à présent via Tinker, le service de personnalisation et de fine tuning lancé en accès anticipé début 2026, avec des fenêtres de contexte de 64 000 et 256 000 tokens et une tarification de lancement fixée à 1,87 dollar le million de tokens en entrée et 4,68 dollars en sortie. Cette sortie marque un tournant stratégique pour un laboratoire jusque là connu surtout pour la notoriété de son équipe fondatrice plutôt que pour des produits concrets. En choisissant d'ouvrir les poids d'Inkling plutôt que de viser la performance brute face à des modèles fermés comme ceux d'OpenAI ou d'Anthropic, Thinking Machines se positionne sur un créneau différent, celui des chercheurs et développeurs souhaitant personnaliser un modèle généraliste solide en chat, audio et vision, quitte à sacrifier une partie des capacités agentiques les plus avancées. Cette approche pourrait séduire des équipes de recherche et des entreprises qui cherchent une base fiable, multimodale et modulable, sans dépendre entièrement des API propriétaires des grands acteurs du secteur, tout en bénéficiant d'un contrôle direct sur les données et la boucle d'entraînement via Tinker. L'initiative s'inscrit dans une stratégie produit plus large amorcée par Thinking Machines dès octobre dernier avec le lancement de Tinker, conçu pour affranchir les chercheurs des contraintes d'infrastructure lors du réglage fin de modèles. Inkling doit désormais nourrir d'autres développements du laboratoire, notamment TLM Interaction Small, un modèle à très faible latence destiné en particulier aux interactions vocales, illustrant une volonté de construire un écosystème cohérent plutôt qu'un modèle isolé. Dans un marché de l'IA générative dominé par une poignée d'acteurs aux modèles fermés, ce pari sur l'ouverture et la personnalisation pourrait redéfinir la place que Thinking Machines entend occuper, entre laboratoires de recherche indépendants et géants technologiques.

UELes chercheurs et développeurs européens pourront exploiter ce modèle a poids ouverts via Tinker, sans impact réglementaire ou économique direct sur la France ou l'UE.

💬 Bon, sur le papier c'est le pari le plus honnête que Thinking Machines pouvait faire : au lieu de courir après OpenAI sur la perf brute, ils ouvrent les poids et misent sur la personnalisation via Tinker. Ça vaut ce que ça vaut face à des géants fermés, mais c'est exactement le créneau qui manquait entre labos indépendants et boîtes qui verrouillent tout. Reste à voir si les chercheurs suivent, parce qu'un modèle ouvert sans écosystème solide autour, ça finit vite sur une étagère.

LLMsActu
1 source
Thinking Machines Lab Inkling : le modèle ouvert pour rebattre les cartes de l’IA ?
4Le Big Data 

Thinking Machines Lab Inkling : le modèle ouvert pour rebattre les cartes de l’IA ?

Thinking Machines Lab, la société fondée par Mira Murati, a publié le 15 juillet 2026 son premier modèle d'intelligence artificielle, baptisé Inkling. Ce grand modèle de langage repose sur une architecture Mixture-of-Experts totalisant 975 milliards de paramètres, dont seulement 41 milliards sont activés pour chaque token traité, un choix qui optimise les ressources de calcul sans sacrifier les performances. Les poids du modèle sont distribués sous licence Apache 2.0 et disponibles sur Hugging Face. Inkling se distingue par une fenêtre de contexte d'un million de tokens, capable d'absorber des bases documentaires volumineuses ou des projets de développement complexes. Son architecture d'attention combine des couches locales et globales selon un ratio de cinq pour un, et utilise un codage de position relatif plutôt que la méthode RoPE employée par la plupart des concurrents. Le modèle est également multimodal : il traite des images d'une résolution allant de 40 à 4096 pixels ainsi que des fichiers audio au format WAV. Contrairement aux chatbots grand public, Inkling vise avant tout les entreprises, les laboratoires de recherche et les équipes d'ingénierie. En ouvrant les poids du modèle, Thinking Machines Lab permet à ses clients de le déployer, de l'adapter à leurs propres données et de construire des applications ou des assistants métiers sur mesure, sans dépendre d'une API externe ni être enfermés dans un écosystème propriétaire. Cette approche permet aussi aux organisations de mieux maîtriser leurs coûts d'exploitation et leur infrastructure. Le modèle n'est toutefois pas open source au sens strict : les données d'entraînement utilisées pour le construire ne sont pas publiées, seule l'architecture et les poids le sont. Cette nuance illustre une tendance plus large du secteur, où des entreprises revendiquent une ouverture partielle tout en gardant la main sur les éléments les plus sensibles de leurs modèles. L'arrivée d'Inkling s'inscrit dans un marché de l'intelligence artificielle de plus en plus disputé entre modèles propriétaires, comme ceux d'OpenAI, Google ou Anthropic, et modèles à poids ouverts. Thinking Machines Lab, fondée par une ancienne dirigeante d'OpenAI, cherche ainsi à se positionner comme une alternative crédible face aux acteurs dominants, en misant sur la flexibilité et le contrôle offerts aux entreprises plutôt que sur une interface grand public. La taille du modèle, avec près de mille milliards de paramètres, et sa fenêtre de contexte étendue, le rapprochent des standards les plus avancés du secteur. Reste à savoir comment la communauté des développeurs va s'emparer de cet outil, et si Thinking Machines Lab publiera d'autres modèles ou services pour construire un écosystème autour d'Inkling.

UELes entreprises et developpeurs europeens peuvent telecharger et deployer librement les poids d'Inkling sous licence Apache 2.0, une option pour la souverainete des donnees face aux API proprietaires americaines.

💬 Inkling coche les cases qui comptent pour une boîte : poids ouverts sous Apache 2.0, un million de tokens de contexte, et seulement 41 milliards de paramètres actifs sur 975 milliards pour ne pas cramer le budget GPU. Bon, appeler ça open source, c'est un peu du flan, les données d'entraînement restent planquées, donc tu hérites de l'architecture, pas de la recette. Le vrai coup de Thinking Machines Lab, c'est de vendre aux entreprises le contrôle de leur infra plutôt qu'un chatbot de plus, et face à des géants qui verrouillent tout dans leur API, ce pari-là peut vraiment rebattre les cartes.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic