Une carte de titre principale (hero) portant « Kolibri : un modèle ouvert de 78B venant d'Allemagne » en grande police grasse, avec une seule ligne plus petite en dessous indiquant « 78B au total / 3,46B actifs / contexte de 1M de tokens / Apache 2.0 », et trois petites icônes linéaires plates alignées, le tout sur fond blanc avec de doux accents en dégradé bleu et cyan et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Le premier jour de Kolibri : Aleph Alpha a rendu publics 78 milliards de poids allemand-anglais, et la réaction devance les preuves

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Vingt-quatre heures après qu'Aleph Alpha a publié Kolibri, la réaction s'est figée en une seule formule, et il vaut la peine de la décortiquer. Le laboratoire de Heidelberg a mis sur Hugging Face, sous Apache 2.0, le 3 octobre 2026, un modèle à mélange d'experts de 78,1 milliards de paramètres, l'a annoncé le même matin dans sa propre salle de presse et depuis son propre compte, et dès le lendemain, le résumé qui circulait dans les fils d'actualité sur l'IA disait : 78 milliards de paramètres au total, 3,46 milliards actifs par token, poids ouverts sous Apache 2.0, conçu pour l'allemand et l'anglais. Chaque proposition de cette phrase est vérifiable à partir du dépôt. Ce qui n'a guère été dit, c'est de savoir quelles parties de la publication relèvent de faits mesurés et lesquelles sont des affirmations que les auteurs ont formulées au sujet de leur propre modèle et que personne en dehors de Heidelberg n'a fait tourner. Cet écart constitue l'histoire du premier jour, et il compte plus que le chiffre phare.

Commençons par la chronologie, car une part surprenante des réactions a traité cela comme une sortie silencieuse et mystérieuse, alors que ce n'en était pas une. Le dépôt Hugging Face Aleph-Alpha/Kolibri-1 a été créé le 2 octobre 2026 à 05:54:02 UTC, la fiche du modèle annonce une date de publication au 3 octobre, et le billet de la newsroom du fournisseur est paru le même matin à 08:43:53 GMT — le jour de la Réunification allemande, une date manifestement choisie par le laboratoire. Le compte d'Aleph Alpha lui-même en a parlé quelques minutes plus tard. Il n'y a eu ni embargo de presse ni événement de lancement, ce qui explique probablement la formulation de « sortie discrète », mais un billet de newsroom d'un fournisseur, un rapport technique et une annonce officielle ne constituent pas une sortie discrète. Il s'agit d'une publication normale que la presse IA généraliste n'a tout simplement pas couverte le jour même.

Le nombre que la réaction répète

Si le chiffre de 3,46 B d'actifs est celui que tout le monde cite, c'est qu'il s'agit du seul nombre de la publication qui change ce qu'un acheteur doit posséder. Kolibri est un transformer de 50 couches dans lequel chaque couche est un mélange d'experts, avec 384 experts par couche, un partagé et six routés, sur un total de 78 103 074 560 paramètres. Par token, il en active 3 457 573 120 — un ratio de parcimonie d'environ 22,6 pour 1. C'est ce qui permet de servir un modèle de 78 milliards de paramètres sur une paire de H100 au lieu d'une baie, et c'est l'affirmation la plus lourde de conséquences de la publication.

Autour de lui figurent les autres chiffres phares, tous issus de la fiche du modèle plutôt que d’une exécution indépendante :

• Contexte — entraîné à 16 384 tokens, entraîné à mi-parcours à 65 536, natif à 262 144, et validé jusqu’à 1 048 576. La fiche recommande de rester à 262 144 ou en dessous pour les tâches sensibles à la latence. Notez bien que le simple « contexte 1 M » que vous verrez dans les résumés correspond au plafond validé, et non à la fenêtre native.

• Précision — poids FP8 en blocs de 128x128 avec des activations quantifiées dynamiquement, évalués avec un cache KV FP8 ; les embeddings, la tête LM, les normalisations et le routeur MoE restent en bfloat16.

• Raisonnement — quatre niveaux d'effort — aucun, faible, moyen, élevé — définis via le template de chat, avec l'appel d'outils Hermes et un parseur vLLM fourni dans le même dépôt que les poids.

• Langues — allemand et anglais, et rien d’autre.

• Entraînement — 20 billions de tokens de pré-entraînement sur un corpus bilingue filtré composé d’environ 62,5 % d’anglais, 23,9 % d’allemand et 13,6 % de code, plus 3,44 billions de tokens d’entraînement intermédiaire et 201 milliards pour l’extension de contexte long.

• Calcul et énergie — 768 NVIDIA B200s répartis sur 96 nœuds HGX, 21 jours de pré-entraînement pour 511 heures et 392 000 heures-GPU à un total déclaré de 6,4x10^23 FLOPs, et une estimation de 9,5x10^2 MWh incluant les frais généraux du centre de données, hors ajustement supervisé et apprentissage par renforcement.

• Licence — Apache 2.0. Aucun avenant relatif à l'usage acceptable, aucun seuil d'utilisateurs actifs mensuels, aucune condition commerciale distincte.

Les deux affirmations que personne n'a vérifiées

Voici la partie du premier jour que la réaction a sautée, et c’est celle qui décide si Kolibri est important ou simplement intéressant.

La première est l’affirmation relative à l’économie de service. La thèse d’Aleph Alpha n’est pas que Kolibri soit le modèle le plus puissant disponible — sur le tableau comparatif du laboratoire lui-même, ce n’est pas le cas, et le laboratoire le dit. Sa thèse est qu’aucun modèle comparé n’offre une meilleure qualité au même coût de service, ou la même qualité à un coût inférieur, le long d’une frontière de Pareto de la qualité en fonction des tokens décodés par seconde et par GPU. Il s’agit d’une affirmation sur le débit sur un matériel donné, et c’est exactement le genre d’affirmation que seul un tiers disposant d’un chronomètre et de deux H100 peut trancher. Personne ne l’a fait. Il n’existe aucune entrée Artificial Analysis pour Kolibri au 4 octobre 2026, ni aucune réplication du harnais d’évaluation par un tiers.

Le deuxième point est l’affirmation sur le tokenizer. Aleph Alpha a entraîné un tokenizer bilingue allemand-anglais avec un vocabulaire de 128 000 tokens en utilisant une méthode qu’elle appelle UniBPE, et rapporte 4,90 octets moyens par token sur du texte web allemand, contre 4,35 pour GPT-5, 4,13 pour Gemini, 4,17 pour Qwen 3.5-3.8, 3,93 pour GLM 5.3, 3,72 pour DeepSeek V4 et 3,28 pour Kimi K3. Chacun de ces chiffres est celui du fournisseur lui-même, mesuré sur son propre corpus, face à des concurrents qu’il a choisis. Avoir plus de texte par token est un effet réel sur le coût d’inférence plutôt qu’une affirmation de qualité, et si cela se vérifie, cela se cumule dans toute charge de travail de traitement de documents — mais il s’agit de la mesure d’un seul laboratoire, pas d’un résultat de benchmark.

L’allemand est l’essentiel, et c’est l’ingénierie la plus intéressante de cette version.

La plupart des fiches de modèle « multilingues » décrivent un mélange d’entraînement qui incluait accessoirement l’allemand. Celle-ci est conçue dans l’autre sens, et la fiche est étonnamment précise sur les mécanismes.

De petites expériences de modèles proxy ont conduit Aleph Alpha à viser environ 20 % de données allemandes dans le mélange, ce qui, pour un entraînement de 20 billions de tokens, signifiait trouver 4 billions de tokens allemands. Les jeux de données allemands ouverts, dédupliqués et filtrés, ont fourni 390 milliards — soit un ordre de grandeur en dessous. Le laboratoire a comblé l'écart de trois manières : en réajustant un filtre Common Crawl spécifiquement pour l'allemand, ce qui a produit 1,3 billion de tokens organiques uniques ; en reformulant des documents allemands existants en entrées d'encyclopédie, en dialogues de questions-réponses et en passages de texte, ce qui a produit environ un billion de plus et est devenu la plus grande source allemande ; et la traduction, qui a été utilisée pour le modèle prédécesseur et délibérément abandonnée pour Kolibri. L'allemand a fini comme un pool unique de 2,4 billions de tokens, dont 80 % ont été sélectionnés ou générés en interne, représentant 21,3 % des tokens de pré-entraînement après suréchantillonnage.

Le détail du filtre est le genre de chose qui ne se révèle que dans un laboratoire qui a réellement été entraîné sur de l'allemand. Un pipeline standard de données linguistiques écarte les documents contenant trop de mots longs — mais la prose administrative allemande dépasse régulièrement la limite anglaise de longueur moyenne des mots, si bien que les réglages par défaut suppriment discrètement le registre dans lequel écrit l'administration publique. Un modèle entraîné sur un filtre anglais standard n'a pour ainsi dire aucun vocabulaire juridico-administratif allemand, et aucun benchmark ne vous le dira.

Ce que le tableau comparatif montre réellement

Aleph Alpha a publié une comparaison post-entraînement portant sur quatorze modèles, et elle est plus utile que la plupart des tableaux de lancement, car elle ne flatte pas le sujet. Sur le même harnais d'évaluation, avec Kolibri à un effort de raisonnement élevé, Qwen3.8 27B obtient 80,2 sur la moyenne anglaise, contre 75,5 pour Kolibri, et 79,9 sur la moyenne allemande, contre 70,8, et il arrive en tête sur GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified et les deux benchmarks de contexte long. Nemotron 3 Super 120B-A12B obtient 73,0 en anglais, contre 75,5 pour Kolibri. Gemma 4 26B-A4B IT obtient 71,9 et 66,3 sur les deux moyennes.

Ainsi, le résumé honnête de la sortie n'est pas « à la pointe de l'art ». C'est que Kolibri se situe au milieu d'un éventail de modèles qui activent entre trois et douze milliards de paramètres par token, qu'il surpasse clairement les modèles bien plus petits, et qu'il perd face à un modèle dense de 27 milliards de paramètres d'Alibaba sur la plupart des lignes de son propre tableau, tout en activant environ un huitième des paramètres. Que l'économie compense cet écart est l'affirmation Pareto, et cette affirmation Pareto n'est pas testée.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Comment vous l'appelleriez réellement, aujourd'hui

Il n'existe aucun point de terminaison hébergé de la part du fournisseur — la publication se compose de poids et d'un rapport technique, sans aucun SKU d'API Aleph Alpha pour Kolibri dans les documents publiés. Il n'existe pas non plus de route pour cela sur OrcaRouter : nous avons exploré le catalogue sous toutes les orthographes du préfixe du fournisseur et du nom du modèle, et Kolibri ne s'y trouve pas, donc l'appeler aujourd'hui implique de télécharger environ 78 Go de poids FP8 et d'exécuter vous-même un point de terminaison vLLM à partir du paquet aleph-alpha-inference ou de l'image de conteneur publiée.

C'est une véritable décision d'achat, pas une note de bas de page, et c'est là qu'une couche de routage mérite sa place, même pour un modèle qu'elle ne prend pas en charge. La comparaison honnête pour quiconque évalue un déploiement souverain auto-hébergé de 78B, ce ne sont pas les lignes de benchmark — c'est 78 Go de VRAM et une discussion d'achat face à un poste facturé au token sur du matériel qui appartient à quelqu'un d'autre. Si ce dont vous avez réellement besoin ce mois-ci est un petit modèle à mélange d'experts que vous pouvez appeler sans acheter deux GPU, le palier Gemma 4 26B-A4B est ce qui s'en approche le plus et qui est déjà disponible sur un point de terminaison routé, à 0,06 $ par million de tokens en entrée et 0,33 $ par million en sortie avec une fenêtre de 262 144, et OrcaRouter route ce palier sur une clé compatible OpenAI au prix catalogue du fournisseur sans rien ajouter. C'est le moyen économique de déterminer si la charge de travail justifie de posséder le matériel avant que celui-ci n'arrive.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

Ce qu'il faut surveiller, et ce qui changerait le verdict

Trois choses, par ordre de leur capacité à faire bouger les lignes.

Une mesure indépendante du débit dans la configuration à deux H100 recommandée pour la carte confirmerait ou réfuterait l’affirmation de Pareto, qui est la seule affirmation du communiqué à être véritablement inédite plutôt qu’une reformulation d’une fiche technique. Une reproduction indépendante des moyennes des suites de tâches en allemand et en anglais vous indiquerait si l’écart avec Qwen3.8 27B est aussi étroit que le suggère le tableau du fournisseur, ou plus étroit encore. Et une évaluation en langue allemande sur de vrais textes administratifs — et non sur un benchmark général traduit — testerait ce pour quoi la version a réellement été conçue, ce qu’aucun classement ne mesure actuellement.

Jusqu’à ce que l’un de ceux-ci se concrétise, le bon cadrage est celui que le dépôt lui-même étaye. Kolibri est une véritable publication à poids ouverts d’un laboratoire européen, à une échelle que les laboratoires européens n’avaient encore jamais atteinte, avec des conditions Apache 2.0 qu’aucun acteur établi n’a égalées, un pipeline de données publié aux côtés des poids, et une histoire d’itération à deux modèles plus intéressante que le chiffre phare. C’est aussi, pour l’instant, un modèle dont les chiffres les plus cités proviennent de ses propres auteurs. Ces deux phrases sont vraies dès le premier jour, et c’est la seconde que la réaction a omise.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.