Aller au contenu principal
Entraînez des modèles d'IA gratuitement avec Unsloth et Hugging Face Jobs
RechercheHuggingFace Blog · 1 min de lecture

Entraînez des modèles d'IA gratuitement avec Unsloth et Hugging Face Jobs

Source originale ↗·

"Apprenez à entraîner des modèles d'IA gratuitement avec Unsloth et Hugging Face Jobs. Utilisez ces outils pour exploiter le pouvoir de l'apprentissage automatique sans dépenser un centime."

Résumé: Exploitez gratuitement le potentiel de l'apprentissage automatique via Unsloth et Hugging Face Jobs pour entraîner des modèles d'IA sans coûts financiers.

Impact France/UE

Offre gratuite d'entraînement de modèles d'IA via Unsloth et Hugging Face Jobs, permettant aux entreprises européennes, y compris en France, de déployer l'apprentissage automatique sans dépenser, en conformité potentielle avec la future AI Act et RGPD.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Grand modèle génomique: IA open source entraînée sur des billions de bases
1Ars Technica AI 

Grand modèle génomique: IA open source entraînée sur des billions de bases

L'équipe d'Evo a développé Evo 2, un modèle d'IA open source formé sur des milliards de paires de bases de l'ADN provenant des trois domaines de la vie (bactéries, archées, et eucaryotes). Après avoir analysé des quantités massives de génomes, Evo 2 a développé des représentations internes de caractéristiques essentielles dans des génomes complexes, y compris des éléments régulateurs de l'ADN et des sites d'splice, souvent difficiles à identifier pour les humains.

UELes laboratoires et instituts de recherche européens en génomique (comme l'Institut Pasteur ou le CEA) peuvent directement exploiter ce modèle open source pour accélérer leurs travaux sur la compréhension des génomes complexes et le développement de thérapies.

RecherchePaper
1 source
Les propriétés de mise à l'échelle des métriques aval dans l'entraînement des grands modèles de langage
2Apple Machine Learning 

Les propriétés de mise à l'échelle des métriques aval dans l'entraînement des grands modèles de langage

Une équipe de chercheurs remet en question une croyance bien ancrée dans le domaine des grands modèles de langage : la performance sur les tâches réelles serait imprévisible à partir du budget d'entraînement. Leur étude propose un cadre direct pour modéliser la progression des benchmarks en fonction des ressources investies, et les résultats sont convaincants. L'enjeu est considérable pour l'industrie. Jusqu'ici, les équipes s'appuyaient sur des métriques intermédiaires comme la perte de pré-entraînement (pretraining loss) pour estimer les capacités futures d'un modèle, sans pouvoir prédire directement ce que ce modèle ferait sur des tâches concrètes. Cette incertitude complique les décisions d'investissement : faut-il entraîner un modèle plus grand, ou sur plus de données ? La réponse restait floue. Les chercheurs démontrent que pour un ratio tokens/paramètres fixé, une simple loi de puissance (power law) suffit à décrire avec précision l'évolution du logarithme de l'accuracy sur plusieurs benchmarks populaires. Contrairement à la procédure en deux étapes proposée précédemment dans la littérature, qui consiste à prédire la loss, puis à convertir cette loss en performance, leur approche directe extrapole mieux et de façon plus fiable. Ces résultats pourraient changer la façon dont les laboratoires planifient leurs runs d'entraînement. Pouvoir anticiper directement la performance sur des tâches aval (downstream tasks), sans passer par une métrique proxy, permettrait d'allouer les budgets de calcul avec plus de précision, de réduire les expériences coûteuses à l'aveugle, et d'accélérer les cycles de développement des futurs LLMs.

RecherchePaper
1 source
Quels modèles d'IA pour la guerre ressemblent réellement
3Wired AI 

Quels modèles d'IA pour la guerre ressemblent réellement

Smack Technologies travaille sur l'entraînement de modèles AI pour planifier des opérations au combat, tandis que d'autres entreprises comme Anthropic discutent des limitations potentielles de l'utilisation militaire de l'IA.

UESmack Technologies' développement de modèles d'IA pour la planification militaire peut impacter la sécurité européenne en renforçant les capacités des armées, potentiellement remodelant l'équilibre des forces et posant des défis aux normes telles que l'AI Act et le RGPD.

RechercheOutil
1 source
Open Dreamer : une reproduction JAX/Flax du modèle Dreamer 4, avec la recette d'entraînement complète publiée
4MarkTechPost 

Open Dreamer : une reproduction JAX/Flax du modèle Dreamer 4, avec la recette d'entraînement complète publiée

Un petit groupe de chercheurs en IA, l'équipe Reactor, a publié Open Dreamer, une implémentation ouverte du pipeline de modèle du monde Dreamer 4, codée en JAX et Flax NNX. Deux dépôts ont été mis en ligne: next-state/open-dreamer contient le pipeline d'entraînement complet, avec un tokenizer vidéo causal, un modèle de dynamique latente conditionné par l'action, la génération de rollouts et le calcul du score FVD, tandis que reactor-team/open-dreamer propose un harnais de rollout local minimal qui génère des images à partir d'un fichier MP4 et d'un fichier d'actions associé. Un troisième élément, une démo dans le navigateur hébergée sur l'infrastructure Reactor, diffuse en temps réel un monde Minecraft généré et propose un bouton pour basculer entre le jeu réel et le rêve, image par image. L'équipe a délibérément limité ses méthodes à celles décrites dans l'article de recherche original sur Dreamer 4, en commençant par CoinRun, un jeu de plateforme 2D procédural entraînable sur un seul GPU, avant d'étendre le pipeline à des séquences de jeu Minecraft au format VPT. L'architecture repose sur un même squelette transformeur causal par blocs, utilisé à la fois pour le tokenizer et le modèle de dynamique, alternant des couches spatiales qui propagent l'information au sein d'une image et des couches temporelles causales qui relient les images entre elles. Le tokenizer, un auto-encodeur masqué plutôt qu'un VAE classique, atteint une compression d'environ 100 fois sans perte de qualité liée aux pertes KL ou adversariales, le masquage rendant selon l'équipe l'espace latent plus facile à diffuser. Le modèle de dynamique prédit l'image suivante via diffusion forcing, flow matching et modèles shortcut, tout en anticipant la prochaine action; les jetons du modèle du monde n'ont toutefois pas accès au jeton de l'agent, si bien que la politique n'influence le futur qu'à travers l'action suivante. Concrètement, le modèle de dynamique Minecraft compte 1,6 milliard de paramètres répartis sur 30 couches, avec 30 têtes d'attention et une attention par requêtes groupées à 3 têtes clé-valeur, entraîné pendant 200 000 étapes avec l'optimiseur Muon et un taux d'apprentissage de pointe de 3e-4. Cette publication détaillée offre à la communauté open source une reproduction fidèle et documentée d'une architecture jusque-là propriétaire, avec des choix d'ingénierie précis sur le parallélisme et l'utilisation du matériel. L'équipe rapporte une utilisation des FLOPs du modèle de 57 à 58 %, proche du seuil de 60 % jugé sain pour l'entraînement de transformeurs, et explique avoir dû composer avec un mur mémoire sur les activations plutôt que sur l'état du modèle, qui tient en environ 24 Gio sur un GPU B200. Ce travail s'inscrit dans une course plus large à la reproduction ouverte des modèles du monde utilisés pour la génération d'environnements interactifs et l'entraînement d'agents.

💬 Le vrai signal ici, c'est que Dreamer 4 sort du placard propriétaire avec la recette d'entraînement complète, pas juste des poids. Ça compte, parce que jusqu'ici les modèles du monde restaient des boîtes noires qu'on citait sans pouvoir vérifier. 57-58% d'utilisation FLOPs sur B200, c'est du sérieux, pas du proof-of-concept bricolé. Reste à voir si ça tient quand quelqu'un d'autre que l'équipe Reactor essaie de le reproduire sur son propre matériel.

RechercheActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic