Aller au contenu principal
LLMsNext INpact · 1 min de lecture

T@LC : on a voulu tester Kimi K3 (1 562 Go) en « local », on a failli finir ruinés

Source originale ↗·

Moonshot AI a mis en ligne les poids de son dernier modèle open source, Kimi K3, fort de 2 800 milliards de paramètres. Concrètement, cela signifie que n'importe qui peut télécharger ce modèle et l'installer en local ou sur une machine louée, plutôt que de passer par les serveurs de l'entreprise chinoise pour l'utiliser. L'intérêt est immédiat pour les professionnels soucieux de confidentialité : garder la main sur ses données et ses prompts sans les transmettre à un tiers. Mais la contrainte technique est écrasante. Pour faire tourner un modèle dans de bonnes conditions, il faut charger l'intégralité de ses paramètres en mémoire, idéalement celle du GPU, la mémoire du CPU restant possible mais au prix de performances dégradées. Avec 2 800 milliards de paramètres à charger, la facture explose : louer les instances GPU nécessaires reviendrait à plusieurs dizaines de milliers d'euros par mois, soit plus de 1 000 euros par jour, avec une note pouvant grimper jusqu'à 43 800 euros selon les configurations testées.

Cette expérience illustre un paradoxe central de l'open source appliqué aux très grands modèles de langage : la liberté de déploiement promise par la publication des poids devient largement théorique dès que la taille du modèle dépasse les capacités matérielles accessibles au commun des entreprises. Seules les organisations disposant d'infrastructures GPU massives, ou d'un budget conséquent pour en louer, peuvent réellement exploiter Kimi K3 en toute autonomie. Pour les autres, la promesse de souveraineté sur les données se heurte à un mur financier.

L'épisode s'inscrit dans une course plus large entre laboratoires chinois et américains autour des modèles massifs en open source, où la taille des architectures ne cesse de grimper sans que les moyens de les faire tourner localement suivent au même rythme. Reste à voir si Moonshot AI ou ses concurrents proposeront des versions allégées, distillées ou quantifiées de Kimi K3, seules solutions réalistes pour démocratiser l'usage local de modèles de cette envergure.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Google lance Gemma 4 12B open source : analyse audio et vidéo, fonctionne en local sur un PC de 16 Go
1VentureBeat AI 

Google lance Gemma 4 12B open source : analyse audio et vidéo, fonctionne en local sur un PC de 16 Go

Google a lancé ce mardi Gemma 4 12B, un modèle d'intelligence artificielle open source de 11,95 milliards de paramètres, publié sous licence Apache 2.0 et conçu pour fonctionner entièrement en local sur un ordinateur portable d'entreprise standard disposant de 16 Go de VRAM ou de mémoire unifiée. Disponible immédiatement en téléchargement gratuit sur Hugging Face et Kaggle, ainsi que via Google AI Edge Gallery, le modèle intègre une fenêtre de contexte de 256 000 tokens, un mode de raisonnement pas à pas, et des capacités natives d'appel de fonctions pour la construction d'agents autonomes. Sa particularité architecturale principale est une structure dite "Unifiée" sans encodeur séparé : les flux audio bruts et les données visuelles sont projetés directement dans l'espace d'embedding du modèle via de simples couches linéaires, le tout sans modules de traitement secondaires. L'encodeur visuel est remplacé par un module de seulement 35 millions de paramètres reposant sur une unique multiplication matricielle, et l'encodeur audio est supprimé entièrement. Cette approche change concrètement les conditions d'utilisation pour les équipes techniques en entreprise. En éliminant les encodeurs secondaires, Gemma 4 12B réduit la latence d'inférence multimodale et abaisse les besoins en mémoire à un seuil atteignable par des machines grand public. Pour les secteurs soumis à des contraintes réglementaires strictes comme la santé, la finance ou la défense, la possibilité de traiter localement des documents confidentiels, du code propriétaire ou des transcriptions de réunions sans envoyer ces données vers des API tierces représente un avantage décisif. Le modèle rivalise par ailleurs en performance avec le Gemma 26B Mixture-of-Experts de Google, malgré un gabarit bien inférieur, ce qui en fait un outil crédible pour des déploiements sans connexion réseau ou dans des environnements à fort niveau de sécurité. Cette publication s'inscrit dans une tendance de fond chez les grands acteurs de l'IA : proposer des modèles capables de tourner à la périphérie du réseau, là où les contraintes de coût, de latence ou de confidentialité rendent les solutions cloud insuffisantes. Alors que la plupart des laboratoires se concentrent sur la course aux modèles toujours plus grands, Google maintient un effort parallèle sur la gamme Gemma pour couvrir les usages embarqués et offline. L'intégration native du mode "thinking" et du tool use positionne Gemma 4 12B comme une base sérieuse pour construire des agents logiciels autonomes fonctionnant sans infrastructure cloud, un segment en pleine expansion à mesure que les entreprises cherchent à déployer l'IA sur des postes de travail isolés ou dans des environnements industriels contraints.

UELe traitement entièrement local sans transmission vers des serveurs tiers facilite la conformité RGPD pour les entreprises européennes des secteurs réglementés comme la santé et la finance.

💬 C'est le genre de truc qu'on attendait depuis 2 ans : un modèle multimodal qui tourne sur ta machine sans envoyer tes données chez Google. Supprimer les encodeurs séparés pour projeter audio et vidéo directement dans l'espace d'embedding, c'est pas du cosmétique, ça réduit la mémoire nécessaire à quelque chose d'atteignable sur du matériel grand public. Pour les boîtes en santé ou finance qui se battent avec le RGPD, t'as enfin une base sérieuse.

LLMsActu
1 source
Google annonce Gemini 3.5 Live Translate pour la traduction vocale en temps réel
2Ars Technica AI 

Google annonce Gemini 3.5 Live Translate pour la traduction vocale en temps réel

Google a annoncé Gemini 3.5 Live Translate, un nouveau modèle d'intelligence artificielle dédié à la traduction vocale instantanée, disponible dans plus de 70 langues. Ce modèle speech-to-speech fait partie de la famille Gemini 3.5 lancée lors de Google I/O, dont seule la version Flash avait jusqu'ici été déployée. La version Live Translate se distingue par une latence très faible, capable de suivre une conversation naturelle avec seulement quelques secondes de décalage, tout en reproduisant l'intonation, le rythme et la tonalité de la voix d'origine plutôt qu'une synthèse vocale générique. L'impact est significatif pour quiconque communique régulièrement dans des langues différentes, que ce soit dans un cadre professionnel, lors de voyages ou dans des contextes médicaux ou juridiques. En s'affranchissant de la nécessité d'avoir un téléphone Pixel ou des écouteurs spécifiques, Google ouvre cette capacité à un public beaucoup plus large. La fidélité vocale, qui préserve les caractéristiques personnelles de la voix du locuteur, représente un saut qualitatif par rapport aux solutions robotiques actuelles, rendant les échanges traduits plus naturels et plus dignes de confiance. Google travaille sur la traduction en temps réel depuis plusieurs années, avec des démonstrations publiques récurrentes lors de ses événements annuels, mais les contraintes matérielles en limitaient l'accès. L'an dernier, la traduction en direct avait été étendue à l'application Google Translate, mais Gemini 3.5 Live Translate marque une nouvelle étape en intégrant cette capacité directement dans un modèle de la série 3.5. Une version Pro de Gemini 3.5 est attendue dans les prochaines semaines, ce qui laisse entrevoir des performances encore supérieures. La course à la traduction universelle s'intensifie, avec des concurrents comme Meta et Microsoft qui investissent également dans ce domaine, faisant de la barrière des langues l'un des prochains grands défis résolus par l'IA.

UELa disponibilité de Gemini 3.5 Live Translate dans plus de 70 langues dont le français facilite la communication multilingue pour les professionnels et entreprises européens sans contrainte matérielle.

💬 C'est le genre de démo qu'on voit à Google I/O depuis quatre ans, sauf que là deux trucs changent vraiment : plus besoin de Pixel ni d'écouteurs spécifiques, et le modèle garde l'intonation et le rythme de la voix d'origine. Ce deuxième point, c'est ce qui rend ça utilisable pour de vrai dans un contexte médical ou légal, pas juste impressionnant en keynote. Reste à voir sur les accents difficiles et le bruit ambiant, mais pour la première fois je prends cette démo au sérieux.

LLMsActu
1 source
Vous avez encore quelques jours pour tester Fable 5 : Anthropic prolonge son accès
3Le Big Data 

Vous avez encore quelques jours pour tester Fable 5 : Anthropic prolonge son accès

Anthropic a annoncé le 7 juillet 2026 la prolongation de l'accès promotionnel à Fable 5, son nouveau modèle Claude, initialement prévu pour s'achever ce même jour. La nouvelle échéance est fixée au 12 juillet 2026 à 23h59 (heure du Pacifique). Cette extension concerne les abonnés Pro, Max, Team et une partie des détenteurs de licences Entreprise Premium, qui peuvent tester le modèle sans frais supplémentaires dans la limite de leur forfait habituel. Les licences Entreprise Standard restent exclues du dispositif, sauf si l'organisation a explicitement activé des crédits d'utilisation. Pendant cette période, Fable 5 peut consommer jusqu'à 50% du quota hebdomadaire inclus dans l'abonnement de l'utilisateur. Le modèle est accessible sur le Web, l'application mobile, Claude Desktop, Claude Cowork, Claude Code, ainsi que dans Claude Design, Microsoft 365, Claude pour les équipes et Claude Tag, simplement en le sélectionnant dans le menu des modèles disponibles, sans activation particulière requise. Cette prolongation vise avant tout à laisser davantage de temps aux utilisateurs pour découvrir les capacités de Fable 5 avant son basculement vers un modèle entièrement payant. Pour les professionnels et développeurs qui exploitent Claude au quotidien, notamment via Claude Code où la version 2.1.170 ou une version plus récente est requise, ce délai supplémentaire permet de tester le modèle sur des cas d'usage réels sans engager de dépenses additionnelles. La disponibilité désormais confirmée sur mobile élargit aussi l'accès pour les utilisateurs en déplacement. Une fois la date du 12 juillet dépassée, Fable 5 sortira du quota hebdomadaire classique des abonnements concernés : toute utilisation continuera de nécessiter le recours aux crédits d'utilisation, facturés en supplément du forfait, ou le repli sur un autre modèle Claude déjà inclus. Cette stratégie s'inscrit dans une logique classique d'adoption progressive des nouveaux modèles d'IA générative, où l'accès gratuit ou inclus sert de levier commercial avant la monétisation complète. Anthropic teste ainsi l'appétit de sa base d'utilisateurs professionnels et entreprise pour Fable 5, tout en encadrant strictement la consommation via les quotas et les règles différenciées entre licences Entreprise Standard et Premium. L'annonce, relayée directement sur le compte X officiel de Claude, confirme aussi la volonté de l'entreprise de maintenir une communication transparente sur les conditions d'accès à mesure que ses modèles évoluent. Reste à voir si cette fenêtre supplémentaire suffira à convaincre davantage d'utilisateurs de basculer vers les crédits payants une fois l'offre promotionnelle définitivement close, ou si la question du coût freinera l'adoption à plus long terme du modèle.

LLMsActu
1 source
La Kimi K3 de la Chine, comme Deepseek, pousse les labos occidentaux à interroger leur avantage en calcul
4The Decoder 

La Kimi K3 de la Chine, comme Deepseek, pousse les labos occidentaux à interroger leur avantage en calcul

Moonshot AI, la startup chinoise derrière Kimi, a dévoilé Kimi K3, un nouveau modèle d'intelligence artificielle qui, selon les premières évaluations, rivalise avec Opus 4.8 d'Anthropic. Fait notable, ce modèle a été développé par une équipe de seulement 300 personnes, un effectif nettement inférieur à celui des grands laboratoires américains. Même Dean W. Ball, stratège chez OpenAI, a qualifié Kimi K3 de "très bon", tout en mettant en garde contre un monde où les modèles à poids ouverts domineraient, qu'il assimile à une forme de "communisme de l'IA". Cette sortie relance un débat crucial dans l'industrie de l'IA : celui de l'importance réelle de la puissance de calcul dans la course aux modèles les plus performants. Si une équipe restreinte peut produire un système comparable aux meilleures offres occidentales, cela remet en question l'idée selon laquelle disposer de ressources de calcul massives constitue un avantage décisif et durable. Pour les laboratoires américains, qui ont investi des milliards dans l'acquisition de puces et d'infrastructures, ce constat soulève des interrogations stratégiques majeures. Kimi K3 s'inscrit dans la lignée de Deepseek, autre modèle chinois qui avait déjà bousculé les certitudes occidentales sur la suprématie technologique américaine en IA. Ces avancées successives interrogent également l'efficacité des restrictions à l'exportation de semi-conducteurs imposées par Washington à la Chine, censées freiner le développement de l'IA chinoise. Alors que les entreprises chinoises continuent de produire des modèles compétitifs malgré ces contraintes, la question de savoir si ces contrôles atteignent réellement leurs objectifs reste plus que jamais ouverte.

💬 Une équipe de 300 personnes qui rivalise avec Opus 4.8, ça remet une sacrée claque au narratif sur l'avantage calcul massif. Chaque modèle chinois qui sort avec moins de moyens prouve un peu plus que les contrôles à l'export américains ratent leur cible. Reste à voir si K3 tient la route en usage réel, pas juste sur les benchmarks.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic