Aller au contenu principal
Accélérez la création de modèles d'embeddings statiques à 400 fois avec Sentence Transformers
RechercheHuggingFace Blog · 1 min de lecture

Accélérez la création de modèles d'embeddings statiques à 400 fois avec Sentence Transformers

Source originale ↗·

"Accélérez les modèles d'emboîtement statique de 400 fois avec Sentence Transformers, une bibliothèque Python optimisée pour générer des vecteurs de phrases efficacement, facilitant les tâches de similarity sémantique."

Résumé: Sentence Transformers, une bibliothèque Python, permet d'accélérer les modèles d'emboîtement statique de 400 fois, offrant une génération rapide et efficace de vecteurs de phrases pour des tâches de similarity sémantique.

Impact France/UE

Sentence Transformers accélèrent la création de modèles d'embeddings statiques pour les entreprises européennes, facilitant les tâches de similarity sémantique en optimisant le processeur de phrases Python.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1The Decoder 

OpenAI transforme la compression de modèle en chasse aux talents avec son défi « Parameter Golf » à 16 Mo

OpenAI lance un défi inédit à la communauté des chercheurs en intelligence artificielle : concevoir le meilleur modèle de langage possible dans une limite de 16 mégaoctets seulement. Baptisée « Parameter Golf », cette compétition transforme l'exercice de compression de modèle en véritable vitrine technique, et en outil de recrutement assumé. L'initiative révèle une tendance de fond dans le secteur : l'efficacité des modèles devient un enjeu stratégique aussi important que leur puissance brute. Alors que la course aux paramètres à l'échelle des centaines de milliards a longtemps dominé la recherche, la capacité à obtenir des performances maximales avec des ressources minimales s'impose désormais comme une compétence différenciante, notamment pour les applications embarquées, mobiles ou à faible latence. La contrainte de 16 Mo est particulièrement sévère : à titre de comparaison, les modèles de la génération actuelle comme GPT-4 ou Llama pèsent plusieurs dizaines de gigaoctets. Atteindre des performances pertinentes dans cet espace revient à résoudre des problèmes de quantification, de distillation et d'architecture qui se situent à la frontière de la recherche fondamentale. OpenAI utilise explicitement la compétition pour identifier les ingénieurs et chercheurs les plus talentueux dans ce domaine précis. Ce type de défi-recrutement n'est pas une nouveauté dans la tech, Google, Meta et DeepMind y ont régulièrement recours via des compétitions de code ou de ML. Ce qui distingue l'approche d'OpenAI ici, c'est la précision du signal recherché : maîtriser la compression de modèle est exactement le profil nécessaire pour faire tourner des LLM directement sur des appareils grand public, un axe stratégique sur lequel la compétition avec Apple, Google et Microsoft s'intensifie.

RechercheActu
1 source
Mélange d'Experts (MoEs) dans les Transformers
2HuggingFace Blog 

Mélange d'Experts (MoEs) dans les Transformers

Traduction et résumé: Les "Mixtures of Experts" (MoE) dans les Transformers permettent une meilleure gestion des ressources en allouant des ressources spécifiques à différentes parties du modèle, augmentant ainsi l'efficacité et la précision. Le modèle Google T5, utilisant MoE, a atteint un record de 91,2 sur le benchmark BLEU pour la traduction anglaise-allemande.

UEGoogle T5, un modèle français, améliore l'efficacité des systèmes de traduction grâce à l'application de "Mixtures of Experts" (MoE) dans les Transformers, conformément à l'AI Act, en obtenant un record de 91,2 sur le benchmark BLEU pour la traduction anglaise-allemande.

RechercheOutil
1 source
Entraînement par anticipation latente pour les Transformers
3Apple Machine Learning 

Entraînement par anticipation latente pour les Transformers

Les modèles de langage autorégressifs sont aujourd'hui entraînés via la prédiction du prochain token, une approche efficace mais fondamentalement limitée : à chaque étape, le modèle doit s'engager sur un choix unique, sans possibilité d'explorer plusieurs continuations plausibles. Une nouvelle recherche, acceptée à l'ICLR 2026 dans le cadre du workshop Latent & Implicit Thinking, propose une alternative : l'entraînement par anticipation latente (Latent Anticipation Training), conçu pour dépasser ces contraintes structurelles. L'enjeu est de taille pour le secteur. L'objectif de prédiction token par token impose une allocation de calcul uniforme : chaque token mobilise exactement un seul passage forward, quelle que soit sa difficulté. Cela bride l'expressivité du modèle sur les tokens complexes, ceux qui nécessiteraient davantage de "réflexion" avant d'être générés. En introduisant une dimension latente dans le processus d'entraînement, l'approche permet au modèle de raisonner implicitement avant de s'engager, ouvrant la voie à un calcul adaptatif selon la difficulté du contexte. Le papier s'inscrit dans un courant de recherche croissant qui cherche à aller au-delà du raisonnement par chaîne de pensée (Chain-of-Thought), en déportant une partie du raisonnement dans un espace latent non visible. Contrairement au CoT classique qui externalise le raisonnement sous forme de tokens intermédiaires explicites, l'anticipation latente opère de manière implicite, sans surcharge du contexte de génération. Cette distinction est centrale : le modèle "pense" sans écrire, ce qui réduit la latence et préserve la fluidité de génération. Si les résultats complets ne sont pas encore publics dans cet extrait, l'acceptation du travail à l'ICLR, l'une des conférences de référence en apprentissage automatique, signale une contribution jugée solide par la communauté. La convergence de plusieurs équipes vers des architectures à raisonnement latent, dont les récents travaux sur les Coconut tokens ou les espaces de pensée continues, suggère que cette direction pourrait redéfinir la prochaine génération de grands modèles de langage.

RecherchePaper
1 source
IndexCache accélère l'inférence des modèles IA sur longs contextes de 1,82x grâce à une attention clairsemée
4VentureBeat AI 

IndexCache accélère l'inférence des modèles IA sur longs contextes de 1,82x grâce à une attention clairsemée

Des chercheurs de l'Université Tsinghua et de Z.ai ont mis au point une technique appelée IndexCache, capable d'accélérer jusqu'à 1,82 fois le temps de génération du premier token et d'augmenter de 1,48 fois le débit de génération pour des contextes de 200 000 tokens. Concrètement, IndexCache supprime jusqu'à 75 % des calculs redondants dans les modèles d'attention sparse, et s'applique aux architectures utilisant DeepSeek Sparse Attention (DSA), notamment les familles de modèles DeepSeek et GLM. Des tests préliminaires ont déjà été conduits sur GLM-5, un modèle de 744 milliards de paramètres, avec des résultats probants en conditions de production. Cette optimisation répond à un problème fondamental des grands modèles de langage : le mécanisme d'auto-attention, qui calcule les relations entre chaque token et tous les précédents, voit sa complexité computationnelle croître de façon quadratique avec la longueur du contexte. L'attention sparse, dont DSA est une implémentation efficace introduite avec DeepSeek-V3.2, résout en partie ce problème en ne traitant qu'un sous-ensemble de tokens pertinents, réduisant la complexité de quadratique à linéaire. Mais les chercheurs ont identifié un goulot d'étranglement résiduel : le module d'indexation léger présent à chaque couche du modèle, chargé de sélectionner ces tokens importants, restait lui-même quadratique, ralentissant considérablement la phase de préfill lors du traitement initial du prompt. IndexCache s'attaque précisément à ce verrou en exploitant une propriété empirique : les couches adjacentes du transformer sélectionnent entre 70 % et 100 % des mêmes tokens. Le système désigne donc un petit nombre de couches "complètes" qui calculent et mettent en cache les indices de tokens, tandis que les couches "partagées" réutilisent simplement ces indices sans recalcul. Contrairement aux techniques classiques de compression du KV cache qui visent à réduire l'empreinte mémoire, IndexCache attaque directement le coût computationnel. L'enjeu est considérable pour les entreprises qui déploient des modèles à grande échelle. Le traitement de longs contextes, documents volumineux, workflows agentiques multi-étapes, raisonnements en chaîne de pensée étendue, représente aujourd'hui l'un des principaux freins économiques à l'adoption des LLM en production, où chaque milliseconde et chaque token coûtent. La course à l'efficacité de l'inférence s'est intensifiée ces derniers mois, avec des approches concurrentes comme la distillation de modèles, la quantification ou la compression du KV cache. IndexCache se positionne comme une technique orthogonale et complémentaire, exploitable sans modification de l'architecture de base. Avec DeepSeek déjà en pointe sur l'optimisation des coûts d'inférence et Z.ai directement impliqué dans ces travaux, la technique a de bonnes chances d'être intégrée rapidement dans les prochaines versions des modèles GLM et DeepSeek, élargissant la fenêtre de contexte praticable sans explosion des coûts.

UELes entreprises et laboratoires européens déployant des modèles DeepSeek ou GLM pourraient bénéficier de gains d'efficacité substantiels sur les inférences longues, réduisant les coûts opérationnels sans modification d'architecture.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic