Kolibri active 3 milliards de paramètres sur 78 et vise l'administration allemande
Aleph Alpha ouvre Kolibri, un mélange d'experts anglais-allemand de 78 milliards de paramètrespoids du modèleNombre de valeurs apprises par un modèle. À quantification égale, plus de paramètres veut dire plus de mémoire occupée, et en général de meilleures réponses.Fiche du lexique dont 3 milliards actifs par tokenPlus petite unité de texte qu'un modèle manipule. Un mot courant tient souvent en un seul, un mot rare se découpe en plusieurs morceaux. Les prix, les limites et les débits s'expriment en tokens, pas en mots.Fiche du lexique, sous licence Apache 2.0 et jusqu'à un million de tokens de fenêtre de contextecontexteQuantité de tokens qu'un modèle peut lire d'un seul coup, question et réponse comprises. Au-delà, il faut découper, résumer ou chercher ailleurs.Fiche du lexique. Le modèle est taillé pour tourner chez le client, dans l'administration publique, l'industrie et l'aérospatial, et l'éditeur le place au niveau de modèles quatre fois plus lourds en paramètres actifs sur les maths, le code et le raisonnement.
par Gyom 5 octobre 2026 à 13:02 4 min de lecture rubrique : Machines et coûts
etiquettes : En entreprise · Local · Sécurité
Aleph Alpha a mis en ligne Kolibri le 3 octobre, jour de la réunification allemande, sous licence Apache 2.0 et avec les poids complets sur Hugging Face. C'est un mélange d'experts anglais-allemand de 78 milliards de paramètres qui n'en active que 3 milliards par token, pour un contexte allant jusqu'à un million de tokens. L'éditeur le destine aux charges critiques et réglementées, administration publique, industrie, aérospatial, et le présente comme exécutable chez le client sans envoyer de données internes à un service d'inférenceExécution d'un modèle : une entrée, une sortie. Le calcul se sépare en un pré-remplissage de la question, puis une génération token par token.Fiche du lexique tiers. Il le place sur la frontière de Pareto du rapport qualité prix, mesuré comme le coût de service au regard du débittokens par secondeNombre de tokens produits par seconde en génération. Avec le temps d'attente du premier token, c'est le chiffre qui dit si un modèle est utilisable au quotidien sur une machine donnée.Fiche du lexique.
Trois milliards de paramètres actifs pour 78 au total
Kolibri tronque la facture par la taille active, pas par la taille totale. Sur les maths, la connaissance, le code et le contexte long, il se place au niveau de modèles jusqu'à quatre fois plus lourds en paramètres actifs, comme Nemotron 3 Super 120B-A12B :
- AIME 2025 : 96,9 % contre 91,7 % pour Nemotron 3 Super et 84,6 % pour Qwen3.6-35B-A3B.
- GPQA diamond : 84,3 % contre 78,0 % et 83,4 %.
- LiveCodeBench v6 : 85,9 % contre 82,0 % et 82,5 %.
- τ²-bench telecom : 94,7 %, au-dessus de Nemotron 3 Super à 68,1 %, mais sous Qwen3.6-35B-A3B à 99,1 %.
Sur l'indice AA-Omniscience, Kolibri marque -32,8, sous Qwen3.6-35B-A3B à -15,3 et Mistral Small 4 à -24,0 : la spécialisation se paie sur la culture générale, et l'éditeur ne le cache pas.
De 30 à 78 milliards de paramètres en trois mois
Kolibri succède à Kolibri Origin, un modèle de 30 milliards de paramètres dont 3 actifs et 65 000 tokens de contexte, sorti le 11 juin. Kolibri a fini son pré-entraînement le 11 septembre :
- 30 à 78 milliards de paramètres totaux, 65 000 à 1 million de tokens de contexte.
- 7 500 à 20 000 milliards de tokens d'entraînement.
- Le tout par la même chaîne, écrite comme du code, qui a fait tourner des centaines d'expériences d'ablation et un pré-entraînement sans intervention humaine quand le matériel tombait.
L'entraînement s'est fait sur des infrastructures en Allemagne et en Finlande, sous droit européen, et l'éditeur revendique la propriété de la chaîne complète, de la curation des données aux évaluations, avec le règlement européen sur l'IA et le code de bonnes pratiques pour l'IA à usage général en ligne de mire.
21,3 % des tokens de pré-entraînement sont allemands
Le modèle est bilingue par construction, pas un modèle anglais ayant lu de l'allemand. Un tokenizer allemand-anglais a été développé pour l'occasion, et 21,3 % des tokens de pré-entraînement sont de l'allemand, avec un recours parcimonieux à la traduction, 6 % du total, parce qu'un texte traduit porte l'empreinte de sa langue d'origine. Sur GPQA diamond en allemand, Kolibri marque 81,3 % contre 76,6 % pour Nemotron 3 Super et 80,6 % pour Qwen3.6-35B-A3B.
Un modèle entraîné à dire qu'il ne sait pas
Kolibri a été entraîné avec des données d'abstention et le protocole Merlin-Arthur de l'éditeur : il refuse de répondre quand le contexte ne soutient pas la réponse. C'est une propriété mesurée, pas une intention déclarée, et elle vise l'usage documentaire où une réponse inventée coûte plus cher qu'une réponse absente.
Cinq métiers mesurés sur des bancs internes
Les bancs publics ne couvrent pas les besoins sectoriels, alors Aleph Alpha a bâti ses propres suites pour les verticales de ses clients, alimentées par des environnements synthétiques sans données client. De Kolibri Origin à Kolibri, les scores internes montent :
- Fournisseur automobile : 0,72 à 0,99.
- Semi-conducteurs : 0,35 à 0,80.
- Secteur public allemand : 0,54 à 0,75.
- Technologie d'entraînement industriel : 0,31 à 0,60.
- Aérospatial : 0,14 à 0,59.
Apache 2.0, servi par vLLM
Kolibri est ouvert sous Apache 2.0 sur Hugging Face et se sert par un greffon vLLM fourni par l'éditeur, avec analyseur de raisonnement et d'appels d'outils dédiés ; au-delà de 262 144 tokens, il faut lever la longueur maximale de modèle. Le rapport technique complet accompagne la sortie, et la licence Apache 2.0 laisse le modèle entrer dans un produit sans négocier de droit d'usage.
Source primaire Aleph Alpha, Kolibri, modèle à poids ouverts