Aller au contenu principal
OutilsMarkTechPost · 2 min de lecture

Unsloth, Axolotl, TRL, LLaMA-Factory : comparaison des frameworks de fine-tuning sur vitesse, VRAM et multi-GPU

Source originale ↗·

Quatre projets open source dominent aujourd'hui le fine-tuning des grands modèles de langage : Unsloth, Axolotl, TRL et LLaMA-Factory. Tous s'appuient sur la même base PyTorch et Hugging Face, mais chacun concentre ses efforts d'ingénierie différemment. TRL sert de couche de référence : il fournit les briques SFTTrainer, DPOTrainer, GRPOTrainer, KTOTrainer, RewardTrainer et RLOOTrainer, sur lesquelles s'appuient Axolotl et LLaMA-Factory, avec une version stable actuelle en v1.8.0. Unsloth réécrit une partie du code de modélisation avec des kernels Triton faits main et une rétropropagation dérivée manuellement plutôt que générée par autograd, sans dégradation de précision par rapport au QLoRA standard selon Hugging Face. Sur un GPU NVIDIA B200, Unsloth annonce des gains spectaculaires pour le modèle gpt-oss-20b-BF16 : 712,33 millisecondes par étape à 8 000 tokens de contexte contre 5 226,86 millisecondes pour Transformers v5, soit un facteur 7,3. Ce gain tombe à 4,82 fois à 4 000 tokens et à seulement 1,37 fois à 1 000 tokens. Sur Qwen3-30B-A3B, la tendance s'inverse : l'accélération chute de 1,7 fois à 1,1 fois entre 1 000 et 16 000 tokens, tandis que les économies de mémoire grimpent de 2 à 15 pour cent. Axolotl a intégré ses propres kernels Triton en février 2025, en citant explicitement Unsloth comme source d'inspiration, avec un support SonicMoE LoRA annoncé jusqu'à 1,45 fois plus rapide et 30 pour cent de mémoire économisée sur Qwen3.5-35B-A3B en LoRA 8 bits sur un seul H100 SXM.

Ces écarts de performance ont un impact direct sur le coût et la faisabilité des projets de fine-tuning, en particulier pour les équipes disposant de ressources GPU limitées. Un facteur multiplicatif de 7 sur le temps d'entraînement change concrètement ce qu'une petite équipe peut se permettre d'entraîner localement plutôt que de sous-traiter à un cloud coûteux. À l'inverse, le fait que certains gains s'inversent selon la longueur de séquence ou le modèle montre qu'aucun framework n'est universellement supérieur : le choix dépend du matériel disponible, de la taille du modèle et de la longueur de contexte visée, ce qui complique la décision pour les praticiens.

Ce paysage s'est construit par emprunts croisés plutôt que par concurrence fermée. LLaMA-Factory, présenté comme démonstration système à la conférence ACL 2024 et doté d'une interface Gradio baptisée LlamaBoard, ne développe pas ses propres kernels mais expose ceux des autres via de simples options de configuration : activer use_unsloth donnerait 170 pour cent de vitesse relative selon son changelog, et le support natif FlashAttention-2 ou Liger Kernel s'active de la même façon. TRL, de son côté, propose une intégration officielle avec Unsloth, ce qui montre que ces outils ne sont pas mutuellement exclusifs mais forment un écosystème où les innovations se propagent rapidement d'un projet à l'autre, au bénéfice final des équipes qui entraînent des modèles avec des budgets de calcul contraints.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Fine-tuning de Qwen3 avec LoRA via NVIDIA NeMo AutoModel : tutoriel complet sur Google Colab (GPU unique)
1MarkTechPost 

Fine-tuning de Qwen3 avec LoRA via NVIDIA NeMo AutoModel : tutoriel complet sur Google Colab (GPU unique)

NVIDIA a publié via son équipe NeMo un tutoriel complet permettant d'entraîner le modèle Qwen3-0.6B avec la technique LoRA (Low-Rank Adaptation) sur un seul GPU, directement dans Google Colab. Le workflow s'appuie sur NeMo AutoModel, une bibliothèque installée depuis son dépôt source sur GitHub, qui reprend une recette officielle de fine-tuning par PEFT (Parameter-Efficient Fine-Tuning) prévue pour Qwen3-0.6B. Le processus commence par une vérification du matériel disponible, à savoir la présence d'un GPU compatible CUDA, sa mémoire vive et son support du format bfloat16, avant de cloner le dépôt Automodel et d'installer les dépendances nécessaires comme PyYAML et PEFT. Le script identifie ensuite automatiquement le fichier de configuration YAML correspondant à la recette Qwen3, puis modifie par programmation ses paramètres de précision, de taille de batch, de points de contrôle et de planification pour l'adapter aux ressources limitées d'un environnement Colab gratuit. L'entraînement est ensuite lancé via l'interface en ligne de commande d'AutoModel, avant de recharger le checkpoint LoRA généré et de comparer les réponses du modèle original avec celles du modèle affiné. Cette démonstration illustre concrètement l'intérêt de l'architecture pilotée par configuration de NeMo AutoModel, capable de fonctionner aussi bien sur un unique GPU grand public que sur des clusters multi-GPU en production, sans changer de logique d'entraînement. Pour les développeurs et chercheurs, cela signifie qu'il devient possible de prototyper un fine-tuning sur un environnement gratuit comme Colab avant de faire évoluer exactement le même pipeline vers une infrastructure distribuée à plus grande échelle, sans réécrire le code. L'utilisation de LoRA permet en outre de réduire drastiquement les besoins en mémoire et en calcul par rapport à un fine-tuning complet, un point crucial quand on ne dispose que d'un seul GPU aux ressources contraintes. Le fait que NeMo AutoModel conserve une interface compatible avec Hugging Face, via la classe NeMoAutoModelForCausalLM, facilite également l'adoption pour les équipes déjà habituées à cet écosystème. Cette publication s'inscrit dans la stratégie plus large de NVIDIA visant à rendre ses outils d'entraînement de modèles de langage accessibles au-delà des seuls environnements d'entreprise dotés de clusters GPU coûteux. En misant sur des recettes préconfigurées et open source pour des modèles compacts comme Qwen3-0.6B, développé par Alibaba, NVIDIA cherche à démocratiser les techniques de fine-tuning efficace en paramètres, alors que la demande pour des modèles spécialisés et peu coûteux à personnaliser continue de croître. Le choix de Google Colab comme terrain de démonstration renforce cette logique d'accessibilité, en montrant que des architectures pensées pour le calcul distribué restent utilisables sur du matériel limité, ce qui pourrait encourager davantage de chercheurs indépendants et de petites équipes à expérimenter avec l'écosystème NeMo.

💬 Le vrai truc ici, c'est que NVIDIA rend le fine-tuning LoRA jouable sur un Colab gratuit, et que le même pipeline scale ensuite vers du multi-GPU sans réécrire une ligne. C'est ça, la promesse qui compte : plus besoin d'un cluster pour prototyper, tu passes direct à la prod si ça marche. Reste à voir combien de temps ça tient avant qu'un vrai projet dépasse les limites de mémoire du Colab gratuit, parce que là on parle d'un modèle 0.6B, pas d'un truc qu'on va déployer tel quel en entreprise.

OutilsTuto
1 source
« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »
2MarkTechPost 

« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »

Datalab a lancé Lift, un outil d'extraction de documents qui promet une approche différente des solutions existantes. Le principe : on lui fournit un PDF ou une image accompagné d'un schéma JSON, et le modèle retourne directement les données structurées correspondantes, sans passer par une conversion intermédiaire en Markdown. Lift s'appuie sur un modèle de vision de 9 milliards de paramètres, capable de lire les images des pages rendues et de produire l'objet JSON final en une seule passe grâce à un décodage contraint par le schéma. Selon les benchmarks internes de Datalab, Lift atteint une précision de champs de 90,2%, contre 81,5% pour son principal concurrent open-weight, NuExtract3, développé par NuMind. Ce dernier, un modèle de 4 milliards de paramètres sous licence Apache-2.0, combine extraction structurée et conversion image-vers-Markdown, et cible des documents comme les factures, reçus, formulaires et contrats. Cette approche change la manière dont les entreprises peuvent construire leurs pipelines de traitement documentaire. Jusqu'à présent, la pratique dominante consistait à convertir un PDF en Markdown ou en texte structuré via des outils comme Docling, MinerU, Marker ou Unstructured, puis à envoyer cette représentation à un grand modèle de langage avec un schéma pour en extraire les champs utiles. Lift propose de fusionner ces deux étapes en une seule, ce qui réduit la complexité du pipeline lorsque l'objectif final est réellement l'extraction de champs précis, comme un numéro de facture, un nom de fournisseur ou une liste de lignes de commande, plutôt que la reconstruction fidèle du document dans son ensemble. Pour les équipes d'ingénierie qui traitent de gros volumes de documents visuellement complexes, cela peut se traduire par moins de composants à maintenir et une latence réduite, au prix d'une dépendance plus forte à un seul modèle propriétaire. Le marché de l'extraction documentaire par IA s'est considérablement densifié ces derniers mois, avec plusieurs catégories d'outils qui se chevauchent sans être toujours en concurrence directe. D'un côté, les parseurs comme Docling, MinerU, Marker, Unstructured, PyMuPDF ou Surya, qui produisent des représentations fidèles du document plutôt que des données applicatives. De l'autre, les extracteurs schéma-first comme Lift, NuExtract3, LlamaExtract, Reducto Extract ou Extend, ainsi que les géants du cloud comme Azure, Google et AWS avec leurs propres systèmes de compréhension documentaire. Des bibliothèques de génération structurée comme XGrammar, Outlines, Instructor ou BAML complètent cet écosystème en garantissant la conformité des sorties JSON. Face à ce paysage fragmenté, le choix entre Lift et ses alternatives dépendra moins de la performance brute que des priorités de chaque équipe : licence permissive, taille du déploiement local, ou besoin d'un modèle unique capable à la fois d'extraire et de convertir en Markdown.

OutilsOutil
1 source
Tutoriel du framework Cosmos de NVIDIA : concevoir une version miniature compatible Colab des modeles de monde Cosmos 3 avec un mélange de transformeurs omnimodal
3MarkTechPost 

Tutoriel du framework Cosmos de NVIDIA : concevoir une version miniature compatible Colab des modeles de monde Cosmos 3 avec un mélange de transformeurs omnimodal

Un nouveau tutoriel technique publié par NVIDIA détaille comment reproduire, à petite échelle, l'architecture de ses modèles de monde Cosmos 3 sur une simple instance Google Colab. Le point de départ est un constat honnête: les vrais points de contrôle (checkpoints) de Cosmos 3, et notamment sa version Nano-16B, nécessitent une puissance de calcul largement hors de portée du matériel Colab standard. Le tutoriel commence par une phase de diagnostic qui compare précisément l'environnement disponible aux exigences réelles du modèle: une architecture GPU Ampere ou supérieure (sm80 et plus, comme les A100 ou RTX 30xx), au moins 80 Gio de mémoire GPU pour un seul GPU H100, une version CUDA 12.8 ou ultérieure, environ 150 Gio d'espace disque libre pour le premier lancement, et jusqu'à 1 To de cache pour Hugging Face, ainsi que des noyaux d'attention optimisés comme FlashAttention-3 sur architecture Hopper. Sans surprise, la majorité des configurations Colab classiques, souvent équipées de GPU T4 en architecture sm75, échouent ce test et rendent impossible toute inférence réelle avec Cosmos 3. Plutôt que de s'arrêter à ce constat, les auteurs du tutoriel utilisent la structure réelle du framework cosmos-framework, son interface en ligne de commande, son schéma d'entrée et ses différents modes de modèles, pour construire une version miniature mais techniquement fidèle du concept. Cette démarche pédagogique permet à des chercheurs et développeurs sans accès à des infrastructures coûteuses de comprendre concrètement le fonctionnement interne des modèles de monde omnimodaux, sans attendre un accès matériel hors budget. C'est une réponse pratique à un problème récurrent dans le développement de l'IA générative de pointe: l'écart croissant entre les capacités des modèles annoncés par les grands laboratoires et les moyens de calcul accessibles à la communauté open source. Le cœur du tutoriel consiste à entraîner un modèle de monde compact reposant sur une architecture Mixture-of-Transformers omnimodale, reprenant l'idée centrale de Cosmos: une attention croisée partagée entre modalités, combinée à un routage vers des experts spécialisés selon qu'il s'agit de texte, de vision ou de flux d'action. À partir de données physiques synthétiques, le modèle apprend par suivi de la perte d'entraînement et par un déroulement autorégressif à prédire les états latents futurs, illustrant de façon simplifiée mais rigoureuse comment ces systèmes multimodaux capturent les relations entre différents types de signaux. Ce type d'initiative s'inscrit dans une tendance plus large de démocratisation des architectures de pointe, où les grandes entreprises comme NVIDIA publient des cadres ouverts permettant à la communauté de s'approprier des concepts avancés malgré des contraintes matérielles très inégales.

💬 80 Gio de VRAM minimum pour faire tourner Cosmos 3, quand toi tu bosses sur un Colab gratuit avec un T4 comme tout le monde: voilà l'écart qui structure l'IA open source aujourd'hui, entre ce que les labos annoncent et ce que la communauté peut vraiment exécuter chez elle. Je trouve le geste honnête, NVIDIA pose le diagnostic dès le départ au lieu de vendre du rêve, et livre une version miniature qui reste fidèle à l'architecture Mixture-of-Transformers. Bon, ça reste un jouet pédagogique, pas un début de Cosmos 3 maison, mais pour piger comment ces modèles routent texte, vision et action entre eux, c'est du concret.

OutilsTuto
1 source
GitHub Copilot lance une application desktop pour les flux de travail multi-agents en parallèle
4InfoQ AI 

GitHub Copilot lance une application desktop pour les flux de travail multi-agents en parallèle

GitHub a lancé une application desktop dédiée à GitHub Copilot, conçue pour orchestrer plusieurs agents IA en parallèle depuis un seul point de contrôle. Baptisée GitHub Copilot app, elle s'adresse aux développeurs qui travaillent déjà avec des agents de codage automatisés et souhaitent superviser leur travail sans jongler entre plusieurs interfaces. Mario Rodriguez, responsable produit chez GitHub, a présenté l'outil sur le blog officiel de l'entreprise, en soulignant que la promesse de rapidité des agents récents s'accompagne trop souvent de "workflows désarticulés, de changements de contexte incessants et d'un temps excessif passé à relire le code généré". L'application cible directement ce problème d'orchestration : plutôt que de lancer un agent à la fois et d'attendre son résultat, les développeurs peuvent désormais piloter plusieurs tâches en parallèle depuis une interface unifiée. Cela réduit le temps mort entre les itérations et permet de conserver une vue d'ensemble sur ce que chaque agent produit, sans perdre le fil du projet. L'enjeu est de rendre le développement assisté par IA réellement fluide en production, et pas seulement dans des démonstrations. Ce lancement intervient dans un contexte de course effrénée entre les grandes plateformes de développement. Cursor, Windsurf, Devin ou encore Claude Code ont chacun proposé leur vision de l'agent de code autonome ces derniers mois. En répondant avec une application desktop centrée sur le contrôle humain et les workflows parallèles, GitHub cherche à repositionner Copilot non plus comme un simple assistant d'autocomplétion, mais comme un véritable système de coordination d'agents, ancré dans l'écosystème Microsoft et les habitudes des 150 millions d'utilisateurs de la plateforme.

UELes développeurs français et européens peuvent adopter cette application pour centraliser la supervision de leurs agents Copilot en parallèle, sans impact réglementaire ou institutionnel spécifique à l'UE.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic