Aller au contenu principal
smol-audio : collection de notebooks Colab pour affiner Whisper, Parakeet, Voxtral, Granite Speech et Audio Flamingo 3
OutilsMarkTechPost · 2 min de lecture

smol-audio : collection de notebooks Colab pour affiner Whisper, Parakeet, Voxtral, Granite Speech et Audio Flamingo 3

Source originale ↗·

L'équipe Deep-unlearning a publié smol-audio, une collection de notebooks Jupyter autonomes conçus pour faciliter le fine-tuning des grands modèles audio du moment. Le dépôt, distribué sous licence Apache-2.0, couvre quatre familles de modèles de reconnaissance automatique de la parole : Whisper d'OpenAI, Parakeet de NVIDIA, Voxtral de Mistral et Granite Speech d'IBM, ainsi que des recettes pour la compréhension audio avec Audio Flamingo 3. Chaque notebook est conçu pour s'exécuter directement dans Google Colab avec un runtime de 16 Go, ce qui le rend accessible gratuitement sans installation locale. L'ensemble repose exclusivement sur l'écosystème Hugging Face, notamment les bibliothèques transformers, datasets, peft et accelerate. L'architecture de chaque modèle impose un traitement différent : Whisper utilise une approche séquence-à-séquence classique, Parakeet repose sur le CTC (Connectionist Temporal Classification), plus rapide à l'inférence, tandis que Voxtral est construit sur un backbone de grand modèle de langage, Ministral 3B pour sa version Mini et Mistral Small 3.1 24B pour sa version Small, ce qui nécessite un masquage des tokens de prompt pendant l'entraînement pour éviter des dynamiques dégradées.

Ce projet comble un vide réel dans la chaîne de travail des ingénieurs en machine learning. Jusqu'ici, les connaissances pratiques pour adapter ces modèles à un nouveau domaine ou une nouvelle langue étaient dispersées entre des issues GitHub, des billets de blog et des notebooks privés jamais partagés. smol-audio expose chaque étape du pipeline sans abstraire la complexité derrière des fonctions de commodité : la boucle d'entraînement est lisible, le pipeline de données est explicite et la configuration est modifiable directement. Pour un ingénieur débutant, c'est un outil pédagogique ; pour un praticien expérimenté, c'est un point de départ de référence qui évite des heures de débogage. Le support du fine-tuning partiel via LoRA (Low-Rank Adaptation) est particulièrement utile pour les modèles lourds comme Parakeet ou Voxtral, où un fine-tuning complet dépasse souvent les ressources disponibles.

Ce lancement s'inscrit dans une année particulièrement dense pour l'audio IA. Les modèles de reconnaissance vocale ont bondi en qualité avec Whisper, Parakeet et Voxtral ; la synthèse vocale conversationnelle a franchi un cap avec Dia-1.6B de Nari Labs ; et Meta a publié le Perception Encoder Audiovisual (PE-AV), un encodeur multimodal capable de construire un espace d'embedding commun entre audio, vidéo et texte. La frontière technique avance vite, mais l'outillage pratique peine à suivre. smol-audio tente de réduire cet écart en standardisant les recettes d'entraînement autour de l'écosystème Hugging Face, qui s'impose progressivement comme infrastructure commune pour l'expérimentation sur ces modèles. Le dépôt devrait s'étoffer à mesure que de nouveaux modèles audio émergent.

Impact France/UE

Le dépôt couvre Voxtral, le modèle audio de Mistral (entreprise française), et permet aux développeurs européens d'adapter ces modèles à des langues régionales ou des domaines métier sans infrastructure coûteuse.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

IBM publie deux modèles Granite Speech 4.1 2B : ASR autorégressif avec traduction et édition non-autorégressive rapide
1MarkTechPost 

IBM publie deux modèles Granite Speech 4.1 2B : ASR autorégressif avec traduction et édition non-autorégressive rapide

IBM a mis en ligne deux nouveaux modèles de reconnaissance vocale open source, Granite Speech 4.1 2B et Granite Speech 4.1 2B-NAR, disponibles sur Hugging Face sous licence Apache 2.0. Ces modèles compacts d'environ 2 milliards de paramètres visent à résoudre un problème classique des équipes IA en entreprise : les systèmes de transcription automatique performants exigent généralement des ressources de calcul importantes, tandis que les solutions légères sacrifient la précision. Les deux modèles partagent une architecture en trois composants, un encodeur audio, un adaptateur de modalité et un modèle de langage, mais divergent sur le mécanisme de décodage. Le modèle standard prend en charge la transcription multilingue et la traduction bidirectionnelle en anglais, français, allemand, espagnol, portugais et japonais. La variante NAR (non-autorégressif) se concentre uniquement sur la transcription, sans le japonais ni la traduction, mais avec des temps de réponse nettement plus rapides. IBM a également lancé discrètement une troisième variante, Granite Speech 4.1 2B-Plus, qui ajoute l'attribution par locuteur et des horodatages au niveau du mot. Sur le leaderboard Open ASR d'avril 2026, le modèle principal affiche un taux d'erreur sur les mots (WER) moyen de 5,33%, avec 1,33% sur le benchmark LibriSpeech clean, des résultats compétitifs pour un modèle de cette taille. L'intérêt concret de ces modèles réside dans leur efficacité à l'inférence. La version NAR utilise un modèle de langage bidirectionnel de 1 milliard de paramètres qui corrige la transcription en une seule passe, sans générer les tokens un à un comme le font les architectures autorégressives classiques. Cela réduit considérablement la latence, ce qui en fait une option sérieuse pour les applications temps réel, centres d'appels, sous-titrage en direct, assistants vocaux embarqués. Pour les équipes qui ont besoin de traduction ou de transcription en japonais, le modèle autorégressif standard reste nécessaire, mais la version NAR offre un avantage décisif dès que la vitesse prime sur la polyvalence. IBM s'inscrit ici dans une tendance de fond : la course aux modèles de reconnaissance vocale ouverts et compétitifs s'est intensifiée depuis qu'OpenAI a publié Whisper en 2022. Plusieurs acteurs, dont Meta et Nvidia, ont depuis proposé leurs propres alternatives, chacun cherchant à optimiser le rapport précision/coût computationnel. La famille Granite, déjà connue pour ses modèles de langage orientés entreprise, s'étend désormais à l'audio avec une approche modulaire et documentée, ce qui facilite l'intégration dans des pipelines existants. La publication sous licence Apache 2.0 permet un usage commercial sans restriction, ce qui devrait accélérer l'adoption dans des secteurs comme la santé, la finance ou les médias, où la transcription précise et souveraine est un enjeu stratégique.

UELes entreprises européennes des secteurs santé, finance et médias peuvent déployer ces modèles en souveraineté complète grâce à la licence Apache 2.0, avec un support natif du français pour la transcription et la traduction.

OutilsOpinion
1 source
Transcription audio multilingue économique à grande échelle avec Parakeet-TDT et AWS Batch
2AWS ML Blog 

Transcription audio multilingue économique à grande échelle avec Parakeet-TDT et AWS Batch

NVIDIA a publié en août 2025 Parakeet-TDT-0.6B-v3, un modèle de transcription automatique de la parole open source couvrant 25 langues européennes, dont le français, l'allemand, l'espagnol, le polonais ou l'ukrainien. Capable de détecter automatiquement la langue parlée, ce modèle affiche un taux d'erreur sur les mots de 6,34 % en conditions acoustiques propres et de 11,66 % à 0 dB de rapport signal/bruit, tout en prenant en charge des fichiers audio allant jusqu'à trois heures. Distribué sous licence CC-BY-4.0, il s'appuie sur une architecture Token-and-Duration Transducer (TDT) qui prédit simultanément les tokens de texte et leur durée, permettant de sauter silences et segments redondants pour atteindre des vitesses d'inférence très largement supérieures au temps réel. Dans la configuration présentée, le modèle tourne sur AWS Batch avec des instances GPU G6 équipées de NVIDIA L4, qui offrent le meilleur ratio coût/performance, bien qu'il soit également compatible avec des instances G5, G4dn ou P5 pour un débit maximal. Le pipeline est entièrement événementiel : un fichier audio déposé sur Amazon S3 déclenche une règle Amazon EventBridge, qui soumet automatiquement un job à AWS Batch, lequel provisionne les ressources, télécharge l'image de conteneur depuis Amazon ECR et restitue une transcription JSON horodatée dans un bucket de sortie. Le coût final descend à quelques fractions de centime par heure d'audio. L'enjeu principal est économique. Pour les organisations traitant des volumes massifs d'audio, qu'il s'agisse d'archives médias, d'enregistrements de centres d'appels, de données d'entraînement pour l'IA ou de sous-titrage vidéo à la demande, les services ASR gérés facturent généralement à la durée réelle du fichier, ce qui fait exploser les coûts dès que les volumes augmentent. En ne payant que de brèves fenêtres de calcul GPU plutôt que la totalité de la durée audio, combiné à l'utilisation d'instances EC2 Spot moins onéreuses et au streaming par tampons, ce pipeline peut réduire la facture de transcription de façon substantielle par rapport aux APIs cloud classiques comme celles d'AWS Transcribe ou de Google Speech-to-Text. La prise en charge native de 25 langues sans configuration par langue supprime également une complexité opérationnelle significative pour les entreprises internationales. Cette approche s'inscrit dans une tendance plus large consistant à substituer des modèles open source performants aux services gérés pour les charges de travail à fort volume. NVIDIA, qui diffuse Parakeet dans le cadre de son écosystème NeMo, cherche à s'imposer comme référence en ASR face à OpenAI avec Whisper, à AssemblyAI ou encore à Amazon Transcribe. Le fait qu'un modèle de 600 millions de paramètres atteigne ces niveaux de précision multilingue ouvre la voie à des pipelines entièrement maîtrisés, hébergés en interne ou dans un cloud privé, sans dépendance à un fournisseur. La prochaine étape logique pour les équipes qui adoptent cette architecture sera d'enchaîner directement en aval des modules de post-traitement automatisés, résumé, analyse de sentiment ou détection d'entités, pour extraire encore plus de valeur des transcriptions produites.

UELe modèle Parakeet couvre nativement 25 langues européennes dont le français, offrant aux organisations françaises et européennes un pipeline de transcription audio économique et souverain, sans dépendance à un service ASR propriétaire.

OutilsTuto
1 source
Le titre traduit : « Tutoriel RAG-Anything : créer un pipeline de récupération multimodal pour texte, tableaux, équations et images dans Colab »
3MarkTechPost 

Le titre traduit : « Tutoriel RAG-Anything : créer un pipeline de récupération multimodal pour texte, tableaux, équations et images dans Colab »

Un tutoriel publié sur MarkTechPost détaille la construction d'un pipeline de récupération multimodale baptisé RAG-Anything, conçu pour traiter simultanément du texte, des tableaux, des équations et des images au sein d'un notebook Google Colab. Le processus démarre par l'installation des dépendances nécessaires, notamment les bibliothèques raganything avec les extensions image et texte, le SDK OpenAI en version 1.0.0 ou supérieure, ainsi que reportlab, pandas, matplotlib et tabulate. Une attention particulière est portée à la bibliothèque Pillow, réinstallée en version 11.3.0 pour éviter les conflits de dépendances, avec un nettoyage systématique du cache des modules Python avant et après cette opération. Le tutoriel configure ensuite un environnement de travail structuré avec des répertoires dédiés aux ressources, aux sorties, au stockage et aux journaux, tout en définissant des paramètres d'exécution comme une taille de chunk de 900 caractères, un chevauchement de 120 caractères et un délai d'expiration de 240 secondes pour les appels aux modèles. La clé API OpenAI est saisie de façon sécurisée au moment de l'exécution plutôt que stockée en dur, une pratique destinée à garder le notebook sûr à partager et à réutiliser. Ce type de démonstration importe car il illustre une tendance de fond dans le développement d'applications basées sur les grands modèles de langage : le passage de systèmes de récupération d'information limités au texte brut vers des architectures capables d'ingérer des documents complexes mêlant graphiques, tableaux de données et formules mathématiques. Pour les équipes techniques qui construisent des assistants documentaires, des outils de recherche interne ou des chatbots d'entreprise, la capacité à interroger un rapport contenant à la fois du texte narratif et des visualisations sans perte d'information représente un gain concret de fidélité et de pertinence des réponses. Le tutoriel montre également comment configurer des fonctions distinctes pour le chat, la vision et les embeddings via l'API OpenAI, une architecture modulaire qui permet d'adapter chaque composant du pipeline à un modèle spécifique selon les besoins de coût ou de performance. Le contexte plus large de ce tutoriel s'inscrit dans l'essor rapide des architectures RAG, ou génération augmentée par récupération, qui combinent des bases de connaissances externes avec la puissance générative des modèles de langage pour produire des réponses ancrées dans des données réelles et vérifiables. Alors que la première génération d'outils RAG se concentrait presque exclusivement sur des corpus textuels, la demande croissante pour des systèmes capables de traiter des rapports financiers, des articles scientifiques ou des documents techniques riches en tableaux et en schémas a poussé des projets comme RAG-Anything à émerger. Le tutoriel teste plusieurs modes de récupération, naïf, local, global et hybride, chacun offrant un compromis différent entre rapidité, précision et compréhension contextuelle. Cette diversité de modes reflète les choix auxquels sont confrontées les équipes qui déploient ces systèmes en production, où le bon équilibre dépend souvent de la nature des documents traités et du volume de requêtes à traiter.

OutilsTuto
1 source
IBM publie Grandite 4.0 : 1 milliard de locutions pour un modèle vocal multilingue compact destiné à l'IA edge et aux pipelines de traduction
4MarkTechPost 

IBM publie Grandite 4.0 : 1 milliard de locutions pour un modèle vocal multilingue compact destiné à l'IA edge et aux pipelines de traduction

IBM vient de publier Granite 4.0 1B Speech, un modèle de reconnaissance et de traduction vocale multilingue conçu pour les déploiements en conditions contraintes, edge computing, faible latence, empreinte mémoire réduite. La particularité de cette version : elle divise par deux le nombre de paramètres de son prédécesseur granite-speech-3.3-2b, tout en étendant les capacités du modèle. Cette sortie s'inscrit dans une tendance de fond dans l'industrie : l'optimisation des modèles pour des environnements hors cloud ou à ressources limitées. Pour les entreprises cherchant à intégrer de la transcription ou de la traduction vocale sans dépendre d'une API externe, pour des raisons de confidentialité, de coût ou de connectivité, un modèle compact et performant sous licence Apache 2.0 représente une alternative crédible aux solutions propriétaires. Le modèle prend en charge la reconnaissance automatique de la parole (ASR) en anglais, français, allemand, espagnol, portugais et japonais, ainsi que la traduction bidirectionnelle (AST) depuis et vers l'anglais pour ces langues, avec des scénarios supplémentaires vers l'italien et le mandarin. Sur le plan des performances, Granite 4.0 1B Speech a récemment décroché la première place du classement OpenASR, avec un taux d'erreur moyen (WER) de 5,52 et un score de vitesse temps réel (RTFx) de 280,02. Sur le corpus de référence LibriSpeech Clean, le WER tombe à 1,42. Techniquement, le modèle repose sur une architecture à deux passes : la transcription audio d'abord, puis un appel séparé au modèle de langage Granite 4.0 pour tout traitement textuel en aval. Le déploiement est supporté nativement via transformers ≥ 4.52.1 et vLLM, avec une interface compatible OpenAI API pour la mise en production. L'ajout du keyword biasing, permettant de guider la transcription vers un vocabulaire métier spécifique directement dans le prompt, et du décodage spéculatif pour accélérer l'inférence renforce l'attrait du modèle pour des usages industriels. IBM positionne ainsi Granite Speech comme une brique modulaire dans des pipelines voix-vers-texte d'entreprise, sans enfermement propriétaire.

UELes entreprises européennes peuvent adopter ce modèle open-source (Apache 2.0) pour déployer de la reconnaissance vocale multilingue en local, sans dépendance cloud, ce qui facilite la conformité RGPD.

OutilsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic