Aller au contenu principal
Recherche · Paper ·

Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod

La société Pathway a développé BDH-CQ, une architecture d'intelligence artificielle inspirée du cerveau humain, baptisée Dragon Hatchling, et l'a entraînée à grande échelle grâce à Amazon SageMaker HyperPod. Contrairement aux grands modèles de langage classiques qui exploitent l'architecture transformeur et externalisent leur raisonnement sous forme de chaînes de pensée textuelles, générant de nombreux tokens intermédiaires avant de produire une réponse, BDH effectue son raisonnement directement dans un espace latent. Le modèle est conçu comme un graphe de neurones communiquant par interactions locales et éparses, dont l'état est maintenu par des connexions de type synaptique qui s'adaptent au contexte sans nécessiter de mise à jour des poids au moment de l'inférence. La variante BDH-CQ actualise la mémoire interne du modèle pendant l'inférence par un calcul itératif au sein d'un état latent récurrent, et ne décode que les réponses candidates finales, sans passage par de longues traces de raisonnement verbalisées. Le système s'intègre à des cadres de développement courants comme PyTorch, et l'infrastructure de calcul partagée d'Amazon permet aux équipes de scientifiques de Pathway de répartir les ressources de façon résiliente et économique.

2 min de lecturePertinence 50

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette approche vise à corriger des limites jugées structurelles dans l'architecture transformeur, en place depuis près de dix ans sans changement majeur. Les modèles actuels peinent à généraliser au-delà de leurs données d'entraînement sur des tâches de raisonnement long, exigent des volumes de données et de calcul considérables, et souffrent d'un oubli catastrophique lorsqu'ils doivent intégrer de nouvelles connaissances sans réentraînement complet. À l'inférence, la fenêtre de contexte fixe et la croissance du cache clé-valeur limitent la longueur des séquences traitées, tandis que les mécanismes d'attention denses consomment beaucoup de mémoire et de calcul, même avec des techniques de mélange d'experts. L'opacité de l'état interne des transformeurs rend aussi leur raisonnement difficile à interpréter ou à auditer, un problème sensible pour les secteurs fortement régulés où la fiabilité et la traçabilité des décisions sont exigées.

Ces limites ont conduit une partie de la recherche à chercher des alternatives ne reposant plus uniquement sur l'augmentation de la taille des modèles, du volume de données ou du calcul consommé à l'inférence. En misant sur une architecture bio-inspirée capable d'apprendre et de raisonner sans traduire chaque étape en texte, Pathway cherche à réduire le coût en tokens du raisonnement tout en conservant une mémoire persistante entre les interactions, un point faible connu des grands modèles actuels qui oublient le contexte d'une session à l'autre. Le recours à l'infrastructure cloud d'Amazon pour l'entraînement illustre par ailleurs comment les fournisseurs de calcul soutiennent désormais des pistes de recherche s'écartant du paradigme transformeur dominant, dans un secteur où la course à l'échelle atteint des limites de coût et d'efficacité de plus en plus visibles.

Impact France / UEChamp produit par Le Fil IA

Pathway, société basée à Paris, développe et entraîne une architecture d'IA alternative aux transformeurs, illustrant la capacité d'un acteur français à mener une recherche architecturale de pointe.

À lire ensuite

01Parcae : une architecture stable pour LLM en boucle aussi performante qu'un transformer deux fois plus grand40MarkTechPostRecherche 02Sakana AI présente KAME : une architecture vocale en tandem qui intègre les connaissances d'un LLM en temps réel45MarkTechPostRecherche 03L’architecture Subquadratic SubQ est-elle le chaînon manquant de l’ère post-Transformer ?36Le Big DataRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.