Aleph Alpha lance Kolibri, un modèle MoE anglais-allemand en poids ouverts de 78,1 milliards de paramètres (3,46 milliards actifs)
Aleph Alpha a publié Kolibri, un modèle de langage open-weight de type Mixture-of-Experts conçu pour l'allemand et l'anglais. Il compte 78,1 milliards de paramètres au total, mais n'en active que 3,46 milliards par token, soit 4,4 %. Il accepte jusqu'à 1 048 576 tokens de contexte et permet de régler l'effort de raisonnement à chaque requête. Il est distribué sur Hugging Face sous licence Apache 2.0. Le checkpoint FP8 pèse environ 78 Go et tourne sur un seul GPU B200, B300 ou H200, ou sur deux H100 SXM5, via vLLM avec des parseurs dédiés au raisonnement et aux appels d'outils. L'architecture empile 50 blocs de largeur 2 560. Chaque couche d'experts évalue 384 experts routés avec un routeur sigmoïde, envoie chaque token vers les 6 meilleurs et fait toujours intervenir un expert partagé. Un bloc sur cinq utilise une attention complète sans encodage positionnel. Les 40 autres recourent à une fenêtre glissante de 512 tokens avec RoPE, si bien que seules 10 couches voient leur cache KV croître avec le contexte. Le vocabulaire de 128 000 tokens atteint 4,90 octets par token en allemand, contre 4,35 pour le tokenizer de GPT-5, soit 11,2 % de tokens en moins. En anglais, il obtient 4,58 contre 4,67. Le pré-entraînement a porté sur 20 000 milliards de tokens avec 768 GPU B200, suivis de 3,44 billions de tokens de mi-entraînement, puis d'une phase longue de 201 milliards de tokens sur des séquences de 262 144 tokens. Plus de 2 billions de tokens allemands ont été ajoutés. Le post-entraînement combine fine-tuning supervisé et apprentissage par renforcement sur plus de 1,2 million de tâches internes.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Sur les benchmarks anglais, Kolibri mène sur GPQA Diamond (84,3), AIME 2025 (96,9) et AIME 2026 (96,0). Il égale Qwen3.5 35B-A3B sur la moyenne agentique anglaise (63,4), mais reste derrière sur BFCL v4 (61,4 contre 70,5). Le modèle dense Qwen3.8 27B obtient un meilleur score global (80,2 en anglais, 79,9 en allemand), au prix d'environ huit fois plus de paramètres actifs par token. Face à son prédécesseur interne Kolibri Origin, le nouveau modèle décode environ 2,7 fois plus de texte par GPU et gagne 21,4 points en anglais. Son intérêt pratique tient à la combinaison d'un coût d'inférence réduit, d'un contexte d'un million de tokens et d'un déploiement sur un ou deux GPU seulement. Cela le rend accessible à des organisations qui doivent héberger leurs modèles elles-mêmes, comme les administrations, l'industrie ou l'aérospatiale. Le protocole Merlin-Arthur apprend en outre au modèle à s'abstenir lorsque le contexte récupéré ne permet pas de répondre, ce qui limite les réponses inventées dans les usages documentaires.
Kolibri s'inscrit dans la quête de souveraineté numérique européenne. Aleph Alpha affirme avoir maîtrisé toute la chaîne, des données à l'évaluation, avec un entraînement mené sur des infrastructures en Allemagne et en Finlande. La conception vise le Code de bonnes pratiques de l'UE pour l'IA à usage général, l'AI Act et le RGPD. L'entreprise est signataire de ce Code, et son pipeline de données supprime les informations personnelles avant l'entraînement. Le modèle se mesure à des concurrents aux architectures variées : Qwen3.6 35B-A3B d'Alibaba (environ 35 milliards de paramètres, 3 milliards actifs), Nemotron 3 Super de NVIDIA (120 milliards, 12 milliards actifs, architecture hybride Mamba-2) et Mistral Small 4 du français Mistral AI (119 milliards, 6,5 milliards actifs, 256 000 tokens de contexte). Kolibri se distingue par son contexte maximal d'environ un million de tokens et par quatre niveaux de raisonnement (aucun, faible, moyen, élevé). Reste à voir si cette approche bilingue et réglementaire suffira à séduire face à des modèles généralistes, souvent plus performants sur les appels d'outils.
Aleph Alpha, signataire du Code de bonnes pratiques de l'UE, propose un modèle ouvert Apache 2.0 conçu pour l'AI Act et le RGPD, auto-hébergeable par les administrations et industries européennes sur un ou deux GPU.