Aller au contenu principal
Recherche · Paper ·

Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod

Pathway, une entreprise spécialisée en architectures d'IA, a développé BDH (Dragon Hatchling), un modèle inspiré du cerveau qui rompt avec le paradigme des transformers dominant depuis une dizaine d'années. Contrairement aux grands modèles de langage classiques, qui externalisent le raisonnement sous forme de chaînes de pensée (chain-of-thought) en générant de longues suites de tokens intermédiaires, BDH effectue son raisonnement directement dans un espace latent. Le modèle est conçu comme un graphe de neurones communiquant par interactions locales et éparses, avec un état maintenu dans des connexions de type synaptique qui s'adaptent au contexte sans mise à jour des poids au moment de l'inférence. Une variante, BDH-CQ, met à jour la mémoire interne du modèle pendant l'inférence via un calcul itératif dans un état latent récurrent, ne décodant que les réponses candidates, sans passage par un raisonnement verbalisé ni besoin de fine-tuning. Pour entraîner et faire évoluer cette architecture, Pathway s'appuie sur Amazon SageMaker HyperPod, qui permet à ses équipes de scientifiques en IA appliquée de partager des ressources de calcul de manière résiliente et économique, tout en s'intégrant à des frameworks courants comme PyTorch.

2 min de lecturePertinence 47

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette approche s'attaque directement aux limites structurelles des transformers, qui pèsent aujourd'hui autant sur l'entraînement que sur l'usage en production. Les transformers peinent à généraliser au-delà de leurs données d'entraînement, notamment sur des tâches de raisonnement long, ce qui oblige à mobiliser des volumes de données et de calcul considérables. Leur mécanisme d'attention et leur cache clé-valeur croissant limitent la longueur des séquences traitables, tandis que leur fonctionnement interne reste largement opaque, compliquant l'interprétation du raisonnement dans des secteurs réglementés où la fiabilité est critique. En proposant un raisonnement moins coûteux en tokens et un modèle capable d'ajuster son état sans réentraînement complet, BDH pourrait réduire les coûts d'inférence tout en limitant le phénomène d'oubli catastrophique qui touche les modèles actuels lors de mises à jour de connaissances. Pour l'industrie, cela ouvre la perspective de systèmes plus économes en calcul et potentiellement plus transparents, un enjeu de plus en plus pressant à mesure que les coûts d'inférence des modèles de raisonnement explosent.

Cette initiative s'inscrit dans un mouvement plus large de remise en question du tout-transformer, alors que la majorité des progrès récents en IA reposait sur l'augmentation de l'échelle des modèles, des données d'entraînement, de la longueur du contexte et du calcul mobilisé à l'inférence. Pathway met en avant le fait que les LLM actuels oublient au fil des longues interactions, ne conservent pas d'information d'une session à l'autre, et nécessitent un réentraînement pour intégrer de nouvelles connaissances, des limites que l'entreprise attribue directement aux choix architecturaux des transformers plutôt qu'à de simples détails d'implémentation. En s'appuyant sur l'infrastructure cloud d'Amazon pour industrialiser l'entraînement de BDH, Pathway signale une volonté de faire passer cette architecture alternative du stade de recherche à un déploiement à plus grande échelle. Reste à voir si cette approche parviendra à s'imposer face à l'écosystème massivement investi dans les transformers, ou si elle restera une piste parmi d'autres explorées par la recherche pour dépasser les limites actuelles des grands modèles de langage.

Impact France / UEChamp produit par Le Fil IA

Pathway, startup franco-européenne, développe une architecture alternative aux transformers, renforçant la contribution européenne a la recherche en IA.

À lire ensuite

01Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod45AWS ML BlogRecherche 02Parcae : une architecture stable pour LLM en boucle aussi performante qu'un transformer deux fois plus grand40MarkTechPostRecherche 03Meta développe une technique de prompting structuré qui améliore nettement la revue de code par les LLMs, atteignant 93 % de précision dans certains cas48VentureBeat AIRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.