Aller au contenu principal
Auto-attention exclusive
RechercheApple Machine Learning · 1 min de lecture

Auto-attention exclusive

Source originale ↗·

Une équipe de chercheurs propose une modification simple mais efficace du mécanisme d'auto-attention au cœur des Transformers : l'auto-attention exclusive (XSA, pour Exclusive Self-Attention). Cette variante améliore les capacités de modélisation de séquences sans bouleverser l'architecture existante.

L'idée centrale repose sur une contrainte appliquée à l'attention : au lieu de laisser chaque token s'appuyer sur sa propre représentation vectorielle, XSA force le modèle à ne capter que les informations orthogonales à son propre vecteur de valeur. En excluant ainsi l'information de position propre au token, le mécanisme est contraint de mieux exploiter le contexte environnant, ce qui est précisément l'objectif d'un bon modèle de langage.

Les résultats sont mesurés sur la tâche standard de modélisation du langage et montrent que XSA surpasse systématiquement l'auto-attention classique sur toutes les tailles de modèles testées, jusqu'à 2,7 milliards de paramètres. Fait notable : les gains augmentent à mesure que la longueur des séquences s'allonge, ce qui suggère un avantage particulièrement marqué pour les contextes longs, un enjeu central dans le développement des LLMs actuels.

Cette contribution s'inscrit dans un courant de recherche visant à optimiser les briques fondamentales des Transformers sans en alourdir le coût computationnel. Si ces gains se confirment à plus grande échelle et sur des benchmarks variés, XSA pourrait devenir une modification standard intégrée dans les prochaines générations de modèles de langage.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Les agents autonomes face au défi entre intention et exécution
1Amazon Science 

Les agents autonomes face au défi entre intention et exécution

Des chercheurs en intelligence artificielle ont publié une étude approfondie sur ce qu'ils nomment l'« écart entre intention et exécution » dans les systèmes d'agents IA, le fossé entre ce qu'un modèle de langage entend faire et ce que le logiciel qui l'entoure réalise concrètement. Pour l'illustrer : un modèle peut vouloir corriger une seule instance d'une fonction dans du code, mais le harnais, le logiciel qui orchestre ses actions et gère ses interactions avec les outils, en modifie involontairement plusieurs. Pour combler cet écart sans aucun ajustement spécifique à une tâche, les chercheurs ont développé Simple Strands Agent (SSA), un harnais léger et personnalisable à agent unique. Testé sur plusieurs benchmarks de référence, dont SWE-Pro, SWE-Verified (qui évaluent la correction automatique de dépôts de code réels) et Terminal-Bench2 (environnements de terminal interactifs), SSA obtient des gains de performance constants sur plusieurs familles de modèles. Ce travail pointe un problème structurel souvent ignoré dans l'évaluation des agents IA : les performances publiées sur les benchmarks reflètent autant la qualité de l'infrastructure d'évaluation que la capacité intrinsèque du modèle. Des facteurs apparemment triviaux, délais d'expiration lors des interactions avec l'environnement, stabilité de l'infrastructure, contraintes de ressources, provoquent des variations de performance significatives. Les auteurs baptisent ce phénomène le « benchmaxing » : la tendance à optimiser les scores publiés sans nécessairement améliorer la capacité réelle du système. Pour les équipes qui déploient des agents en production, cela signifie qu'un gain impressionnant sur un benchmark peut disparaître entièrement dans un contexte légèrement différent, rendant les comparaisons entre systèmes peu fiables. L'étude s'inscrit dans un débat plus large sur la conception des agents IA. Pendant des années, la priorité a été donnée aux optimisations spécifiques : prompts ajustés, outils sur mesure, graphes d'exécution spécialisés. Or les chercheurs montrent que ces gains sont souvent fragiles, ce qui fonctionne pour un modèle ou une version donnée se dégrade ou régresse avec les modèles suivants, car ces optimisations surajustent implicitement le comportement d'un modèle particulier. La conclusion est qu'il faut désormais identifier des principes de conception invariants, valables quel que soit le modèle sous-jacent. L'interface entre modèle et harnais devient ainsi un domaine de recherche central, à l'image du rôle d'un système d'exploitation vis-à-vis d'un processeur. Les auteurs soulignent également que cette conception n'est pas entièrement agnostique au modèle : différentes familles de modèles ont des préférences distinctes en matière d'utilisation des outils et d'interprétation du contexte, faisant de la coconception modèle-harnais un levier décisif pour atteindre des performances optimales.

RecherchePaper
1 source
L'attention paginée dans les grands modèles de langage
2MarkTechPost 

L'attention paginée dans les grands modèles de langage

La gestion de la mémoire GPU constitue aujourd'hui le principal goulot d'étranglement dans le déploiement des grands modèles de langage à grande échelle. L'attention paginée (Paged Attention) apporte une réponse concrète à ce problème en s'inspirant du mécanisme de mémoire virtuelle des systèmes d'exploitation, permettant de multiplier significativement le nombre de requêtes traitées simultanément sans augmenter le parc matériel. L'enjeu est considérable pour les opérateurs d'infrastructure IA. Avec l'approche classique, chaque requête se voit attribuer un bloc de mémoire fixe dimensionné au pire cas, la longueur maximale de séquence, même si la réponse générée est bien plus courte. Ce gaspillage structurel plafonne la concurrence bien avant que le GPU soit saturé computationnellement, forçant les équipes à surprovisioner le matériel ou à limiter arbitrairement le nombre d'utilisateurs simultanés. Les chiffres illustrent l'ampleur du problème : avec un modèle de type GPT à 32 couches, 32 têtes d'attention et une dimension de 128 par tête stockée en fp16, chaque token du cache KV représente 524 288 octets (512 Ko). Pour une séquence maximale de 2 048 tokens, chaque requête pré-alloue 1 024 Mo de VRAM, mais n'en utilise en moyenne que 250 Mo pour une réponse typique de 500 tokens, soit un taux d'utilisation de seulement 24,4 %. Sur 100 utilisateurs simultanés, ce sont 75 Go de mémoire GPU immobilisés inutilement. L'attention paginée résout cela en découpant le cache KV en blocs de 16 tokens alloués à la demande, et en permettant le partage de préfixes identiques entre requêtes via un mécanisme de Copy-on-Write. Cette approche, popularisée par le moteur d'inférence vLLM, représente aujourd'hui une brique fondamentale pour tout système de production sérieux. Les gains en débit sont substantiels dès les charges modérées, l'article mesure l'écart d'utilisation mémoire sur des batchs de 10 à 200 requêtes simultanées, et permettent de différer ou d'éviter des investissements matériels coûteux pour les équipes qui déploient des LLMs à l'échelle.

RecherchePaper
1 source
Harness Engineering pour l'auto-amélioration
3Lilian Weng 

Harness Engineering pour l'auto-amélioration

Le concept d'amélioration récursive de soi-même par une intelligence artificielle remonte à 1965, lorsque le mathématicien britannique I. J. Good a théorisé la notion de "machine ultra-intelligente", un système capable de surpasser l'humain dans toutes les activités intellectuelles et de concevoir des machines encore meilleures pour se perfectionner lui-même. Plus de quarante ans plus tard, en 2008, le chercheur Eliezer Yudkowsky a formalisé cette idée sous l'expression "recursive self-improvement" (amélioration récursive de soi), désignant une boucle de rétroaction précise: une IA utilise son intelligence actuelle pour améliorer les mécanismes cognitifs qui produisent cette même intelligence. Dans les systèmes d'IA modernes, cette boucle peut prendre deux formes concrètes, soit un modèle qui réécrit directement ses propres poids neuronaux, soit, plus largement, un modèle qui optimise son propre pipeline d'entraînement et son système de déploiement, ce qui permet ensuite de produire un modèle successeur plus performant sur des tâches à forte valeur économique. Cette dynamique n'est plus purement théorique: les laboratoires d'IA de pointe, notamment Anthropic et OpenAI, constatent une accélération marquée du rythme de leurs propres travaux de recherche grâce à l'usage de leurs modèles pour assister le développement des suivants. Concrètement, cela signifie que les cycles d'itération entre versions de modèles se raccourcissent, et que les capacités des systèmes progressent plus vite qu'avec des méthodes de développement uniquement humaines. Pour l'industrie, cela pose la question de la maîtrise de ces boucles d'auto-amélioration et de la nécessité de concevoir des environnements de test rigoureux, ce que les chercheurs appellent l'"ingénierie de harnais", pour encadrer et vérifier ces gains de performance. Cette accélération ravive un débat qui traverse la recherche en IA depuis six décennies, celui du point de bascule où une intelligence artificielle deviendrait capable de s'améliorer plus vite que ses créateurs ne peuvent la superviser. Les enjeux touchent à la fois à la sécurité, à la gouvernance des laboratoires et à la vitesse d'arrivée de capacités transformatrices, sujets qui mobilisent aujourd'hui autant les équipes de recherche que les régulateurs à travers le monde.

RechercheOpinion
1 source
RayRoPE : encodage positionnel projectif par rayons pour l'attention multi-vues
4Apple Machine Learning 

RayRoPE : encodage positionnel projectif par rayons pour l'attention multi-vues

Des chercheurs en vision par ordinateur présentent RayRoPE, une nouvelle méthode d'encodage positionnel destinée aux transformeurs multi-vues, ces modèles qui traitent simultanément des tokens issus de plusieurs images prises sous différents angles avec une caméra localisée dans l'espace. L'objectif est de doter chaque patch d'image d'une position unique tout en permettant une attention invariante aux transformations rigides SE(3), c'est à dire insensible aux rotations et translations de la scène filmée, avec une similarité à plusieurs fréquences. La méthode s'appuie sur le rayon optique associé à chaque patch, mais au lieu d'utiliser uniquement sa direction, comme le font les approches existantes, RayRoPE exploite un point prédit le long de ce rayon pour encoder la position de manière adaptée à la géométrie réelle de la scène. Cette avancée technique cible un problème central pour les systèmes de vision par ordinateur en 3D, comme la reconstruction de scènes, la génération de vues nouvelles ou la navigation robotique à partir de plusieurs caméras. Les chercheurs montrent que les schémas d'encodage existants, qu'ils soient absolus ou relatifs, échouent à combiner simultanément unicité, invariance géométrique et adaptabilité à la structure de la scène observée. En comblant cette lacune, RayRoPE pourrait améliorer la précision et la robustesse des modèles qui doivent raisonner sur la position relative d'objets capturés sous des angles multiples. Ces travaux s'inscrivent dans une dynamique de recherche plus large autour des encodages positionnels rotatifs, popularisés par RoPE dans les modèles de langage, désormais adaptés aux données visuelles tridimensionnelles. À mesure que les applications de perception multi-caméra se multiplient, en robotique, en réalité augmentée ou dans les véhicules autonomes, la capacité des transformeurs à comprendre la géométrie 3D sous-jacente aux images devient un enjeu de recherche majeur, ouvrant la voie à des architectures encore plus fidèles à la structure réelle du monde observé.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic