Eine Hero-Titelkarte „Kolibri: ein 78B-Open-Weight-Modell aus Deutschland“ in großer fetter Schrift, mit einer einzigen kleineren Zeile darunter: „78B gesamt / 3,46B aktiv / 1M-Token-Kontext / Apache 2.0“, und drei kleine Linien-Icons in einer Reihe, auf einem weißen Hintergrund mit sanften blau-cyanfarbenen Akzenten und dem Orim in der unteren rechten Ecke.
Guides & Insights

Kolibris erster Tag: Aleph Alpha hat 78B deutsch-englische Gewichte freigegeben, und die Reaktion eilt der Beweislage voraus

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Vierundzwanzig Stunden, nachdem Aleph Alpha Kolibri veröffentlicht hatte, hat sich die Reaktion auf eine einzige Zeile verfestigt, und es lohnt sich, diese Zeile auseinanderzunehmen. Das Heidelberger Labor stellte am 3. Oktober 2026 ein Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern unter Apache 2.0 auf Hugging Face, kündigte es am selben Morgen im eigenen Newsroom und über den eigenen Account an, und am nächsten Tag lautete die in KI-Feeds kursierende Zusammenfassung: 78 Mrd. Gesamtparameter, 3,46 Mrd. aktiv pro Token, offene Gewichte unter Apache 2.0, gebaut für Deutsch und Englisch. Jeder Teilsatz dieses Satzes lässt sich anhand des Repositorys überprüfen. Weitgehend unausgesprochen blieb, welche Teile der Veröffentlichung gemessene Fakten sind und welche Behauptungen der Autoren über ihr eigenes Modell, die niemand außerhalb Heidelbergs hat laufen lassen. Diese Kluft ist die Geschichte des ersten Tages, und sie ist wichtiger als die Schlagzeilenzahl.

Beginnen wir mit der Zeitachse, denn ein überraschend großer Teil der Reaktionen behandelte dies als einen mysteriösen stillen Release, und das war es nicht. Das Hugging-Face-Repository Aleph-Alpha/Kolibri-1 wurde am 2. Oktober 2026 um 05:54:02 UTC erstellt, auf der Modellkarte ist als Veröffentlichungsdatum der 3. Oktober angegeben, und der Newsroom-Beitrag des Anbieters erschien am selben Morgen um 08:43:53 GMT — am Tag der Deutschen Einheit, einem Datum, das das Labor eindeutig gewählt hat. Der eigene Account von Aleph Alpha postete innerhalb weniger Minuten darüber. Es gab kein Presseembargo und keine Launch-Veranstaltung, was wahrscheinlich der Ursprung der Einordnung als „stiller Release“ war, aber ein Newsroom-Beitrag eines Anbieters, ein technischer Bericht und eine offizielle Ankündigung sind kein stiller Release. Sie sind ein normaler Release, über den die allgemeine KI-Presse an diesem Tag schlicht nicht berichtete.

Die Zahl, die die Reaktion wiederholt

Der Grund, warum 3,46B aktiv die Zahl ist, die alle zitieren, ist, dass sie die einzige Zahl in der Veröffentlichung ist, die daran etwas ändert, was ein Käufer besitzen muss. Kolibri ist ein 50-Schichten-Transformer, in dem jede Schicht Mixture-of-Experts ist, mit 384 Experten pro Schicht, einem gemeinsamen und sechs gerouteten, über insgesamt 78.103.074.560 Parameter. Pro Token aktiviert es 3.457.573.120 davon – ein Sparsity-Verhältnis von ungefähr 22,6 zu 1. Das ist es, was ein Modell mit 78 Milliarden Parametern auf einem Paar H100s statt auf einem ganzen Rack bereitstellbar macht, und es ist die folgenreichste einzelne Behauptung in der Veröffentlichung.

Darum herum stehen die anderen Schlagzeilen-Kennzahlen, allesamt aus der Modellkarte statt aus einem unabhängigen Durchlauf:

• Kontext – trainiert bei 16.384 Tokens, mitteltrainiert bei 65.536, nativ bei 262.144 und validiert bis zu 1.048.576. Die Karte empfiehlt, für latenzkritische Arbeiten bei oder unter 262.144 zu bleiben. Beachten Sie sorgfältig, dass der pauschale „1M-Kontext“, den Sie in Zusammenfassungen sehen, die validierte Obergrenze und nicht das native Fenster ist.

• Präzision — FP8-Gewichte in 128x128-Blöcken mit dynamisch quantisierten Aktivierungen, ausgewertet mit einem FP8-KV-Cache; Embeddings, der LM-Head, die Normalisierungsschichten und der MoE-Router bleiben in bfloat16.

• Reasoning — vier Aufwandsstufen — keine, niedrig, mittel, hoch — festgelegt über die Chat-Vorlage, mit Tool-Calling im Hermes-Stil und einem vLLM-Parser, der im selben Repository wie die Gewichte ausgeliefert wird.

• Sprachen — Deutsch und Englisch, und nichts anderes.

• Training — 20 Billionen Pre-Training-Tokens über einen gefilterten zweisprachigen Korpus, der ungefähr 62,5 Prozent Englisch, 23,9 Prozent Deutsch und 13,6 Prozent Code umfasst, plus 3,44 Billionen Mid-Training-Tokens und 201 Milliarden für die Long-Context-Erweiterung.

• Rechenleistung und Energie — 768 NVIDIA B200 über 96 HGX-Knoten, 21 Tage Vortraining für 511 Stunden und 392.000 GPU-Stunden bei berichteten 6,4x10^23 FLOPs sowie geschätzten 9,5x10^2 MWh einschließlich Rechenzentrums-Overhead, ohne überwachtes Feintuning und bestärkendes Lernen.

• Lizenz — Apache 2.0. Keine Zusatzklausel zur akzeptablen Nutzung, keine Schwelle für monatlich aktive Nutzer, keine gesonderten kommerziellen Bedingungen.

Die zwei Behauptungen, die niemand überprüft hat

Dies ist der Teil von Tag eins, den die Reaktion übersprungen hat, und er entscheidet darüber, ob Kolibri wichtig oder lediglich interessant ist.

Die erste ist die Behauptung zur Serving-Ökonomie. Aleph Alphas Darstellung ist nicht, dass Kolibri das stärkste verfügbare Modell ist – auf der eigenen Vergleichstabelle des Labs ist es das nicht, und das Lab sagt das selbst. Ihre Darstellung ist, dass kein verglichenes Modell mehr Qualität bei gleichen Serving-Kosten oder dieselbe Qualität bei niedrigeren Kosten entlang einer Pareto-Front von Qualität gegenüber dekodierten Tokens pro Sekunde pro GPU liefert. Das ist eine Aussage über den Durchsatz auf bestimmter Hardware, und es ist genau die Art von Aussage, die nur ein Dritter mit einer Stoppuhr und zwei H100s klären kann. Niemand hat das getan. Es gibt keinen Eintrag bei Artificial Analysis für Kolibri mit Stand vom 4. Oktober 2026 und keine von Dritten durchgeführte Replikation des Evaluierungs-Harness.

Der zweite Punkt ist die Tokenizer-Behauptung. Aleph Alpha hat einen bilingualen deutsch-englischen Tokenizer mit einem Vokabular von 128.000 Token trainiert, und zwar mit einer Methode, die das Unternehmen UniBPE nennt, und gibt für deutschen Webtext durchschnittlich 4,90 Bytes pro Token an, gegenüber GPT-5 mit 4,35, Gemini mit 4,13, Qwen 3.5-3.8 mit 4,17, GLM 5.3 mit 3,93, DeepSeek V4 mit 3,72 und Kimi K3 mit 3,28. Jede einzelne dieser Zahlen stammt vom Anbieter selbst, gemessen auf dem eigenen Korpus des Anbieters, gegen Wettbewerber, die der Anbieter selbst ausgewählt hat. Mehr Text pro Token ist ein echter Inferenzkosten-Effekt und keine Qualitätsbehauptung, und wenn er zutrifft, summiert er sich über jede Workload zur Dokumentenverarbeitung hinweg – aber es ist die Messung eines einzelnen Labors, kein Benchmark-Ergebnis.

Deutsch ist der Punkt, und es ist die interessanteste Ingenieursleistung in der Veröffentlichung

Die meisten „mehrsprachigen“ Modellkarten beschreiben einen Trainingsmix, der zufällig auch Deutsch enthielt. Diese hier ist genau umgekehrt aufgebaut, und die Karte ist ungewöhnlich konkret, was die Mechanik angeht.

Kleine Experimente mit Proxy-Modellen führten bei Aleph Alpha zu einem Ziel von rund 20 Prozent deutschen Daten im Mix, was für einen Lauf mit 20 Billionen Tokens bedeutete, 4 Billionen deutsche Tokens zu finden. Deduplizierte und gefilterte offene deutsche Datensätze lieferten 390 Milliarden – eine Größenordnung zu wenig. Das Labor schloss die Lücke auf drei Wegen: die Neujustierung eines Common-Crawl-Filters speziell für Deutsch, was 1,3 Billionen einzigartige organische Tokens ergab; das Umformulieren bestehender deutscher Dokumente in Enzyklopädie-Einträge, Frage-und-Antwort-Dialoge und Textpassagen, was etwa eine weitere Billion ergab und zur größten einzelnen deutschen Quelle wurde; und Übersetzung, die für das Vorgängermodell verwendet und für Kolibri bewusst fallengelassen wurde. Deutsch endete als einzigartiger Pool von 2,4 Billionen Tokens, zu 80 Prozent intern kuratiert oder generiert, der nach Upsampling auf 21,3 Prozent der Pre-Training-Tokens kam.

Das Filterdetail ist die Art von Sache, die nur in einem Labor auftaucht, das tatsächlich auf Deutsch trainiert wurde. Eine Standard-Pipeline für Sprachdaten verwirft Dokumente mit zu vielen langen Wörtern – doch deutsche Verwaltungsprosa überschreitet routinemäßig den englischen Grenzwert für die durchschnittliche Wortlänge, sodass Standardeinstellungen stillschweigend das Register löschen, in dem die öffentliche Verwaltung schreibt. Ein Modell, das mit einem englischen Standardfilter trainiert wurde, hat so gut wie kein deutsches rechts- und verwaltungssprachliches Vokabular, und kein Benchmark wird einem das sagen.

Was die Vergleichstabelle tatsächlich zeigt

Aleph Alpha hat einen Post-Training-Vergleich über vierzehn Modelle veröffentlicht, und er ist nützlicher als die meisten Launch-Tabellen, weil er das Testobjekt nicht schönfärbt. Im selben Testaufbau mit Kolibri bei hohem Reasoning-Aufwand erreicht Qwen.8 27B 80,2 im englischen Durchschnitt gegenüber Kolibris 75,5 und 79,9 im deutschen Durchschnitt gegenüber 70,8, und liegt bei GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified und beiden Long-Context-Benchmarks vorn. Nemotron 3 Super 120B-A12B erreicht 73,0 im Englischen gegenüber Kolibris 75,5. Gemma 4 26B-A4B IT erreicht 71,9 und 66,3 in den beiden Durchschnitten.

Die ehrliche Zusammenfassung des Releases ist also nicht „State of the Art“. Sie lautet vielmehr, dass Kolibri mitten in einem Feld von Modellen sitzt, die pro Token zwischen drei und zwölf Milliarden Parameter aktivieren, dass es die deutlich kleineren klar schlägt und dass es gegen ein dichtes Modell mit 27 Milliarden Parametern von Alibaba in den meisten Zeilen seiner eigenen Tabelle verliert, während es ungefähr ein Achtel der Parameter aktiviert. Ob die Energie-Rettung dieser Lücke der Pareto-Anspruch ist – und der Pareto-Anspruch ist ungetestet.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Wie du es heute tatsächlich nennen würdest

Es gibt keinen gehosteten Endpunkt vom Anbieter — das Release besteht aus Gewichten plus einem technischen Bericht, ohne Aleph Alpha API SKU für Kolibri im veröffentlichten Material. Auch auf OrcaRouter gibt es keine Route dafür: Wir haben den Katalog unter jeder Schreibweise des Anbieterpräfixes und des Modellnamens durchsucht, und Kolibri taucht dort nicht auf, sodass ein heutiger Aufruf bedeutet, etwa 78 GB FP8-Gewichte herunterzuladen und selbst einen vLLM-Endpunkt aus dem aleph-alpha-inference-Paket oder dem veröffentlichten Container-Image zu betreiben.

Das ist eine echte Beschaffungsentscheidung, keine Fußnote, und genau hier verdient sich eine Routing-Schicht ihren Platz, selbst für ein Modell, das sie nicht selbst bereitstellt. Der ehrliche Vergleich für alle, die ein selbst gehostetes souveränes 78B-Deployment abwägen, sind nicht Benchmark-Zeilen – es sind 78 GB VRAM und ein Beschaffungsgespräch gegenüber einem Per-Token-Posten auf Hardware, die jemand anderem gehört. Wenn Sie diesen Monat tatsächlich ein kleines Mixture-of-Experts-Modell brauchen, das Sie aufrufen können, ohne zwei GPUs zu kaufen, ist die Gemma 4 26B-A4B-Stufe das Nächstliegende, das bereits auf einem gerouteten Endpunkt verfügbar ist – für $0,06 pro Million Eingabe-Tokens und $0,33 pro Million Ausgabe-Tokens mit einem 262.144-Token-Fenster, und OrcaRouter leitet diese Stufe über einen OpenAI-kompatiblen Schlüssel zum Listenpreis des Anbieters weiter, ohne etwas draufzuschlagen. Das ist der günstige Weg herauszufinden, ob die Workload den Besitz der Hardware rechtfertigt, bevor die Hardware eintrifft.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

Worauf man achten sollte und was das Urteil ändern würde

Drei Dinge, geordnet danach, wie stark sie das Bild verändern würden.

Eine unabhängige Durchsatzmessung in der für die Karte empfohlenen Zwei-H100-Konfiguration würde die Pareto-Behauptung bestätigen oder widerlegen – die einzige Behauptung in der Veröffentlichung, die wirklich neu ist und nicht bloß die Wiederholung eines Datenblatts. Eine unabhängige Reproduktion der durchschnittlichen Task-Scores für Deutsch und Englisch würde zeigen, ob der Abstand zu Qwen3.8 27B so schmal ist wie in der Tabelle des Anbieters oder noch schmaler. Ein unabhängiger Test mit echten Verwaltungsdaten – nicht mit einem übersetzten allgemeinen Benchmark – würde das prüfen, wofür die Veröffentlichung tatsächlich entwickelt wurde, was derzeit keine Rangliste misst.

Bis eines davon eintrifft, ist die richtige Einordnung die, die das Repository selbst hergibt. Kolibri ist eine echte Open-Weights-Veröffentlichung aus einem europäischen Labor, in einem Umfang, wie ihn europäische Labore zuvor noch nicht veröffentlicht haben, mit Apache-2.0-Bedingungen, die kein etablierter Anbieter geboten hat, einer zusammen mit den Gewichten veröffentlichten Datenpipeline und einer Iterationsgeschichte über zwei Modelle, die interessanter ist als die Zahl, die in den Schlagzeilen steht. Außerdem ist es vorerst ein Modell, dessen meistzitierte Zahlen von seinen eigenen Autoren stammen. Beide Sätze stimmen am ersten Tag, und der zweite ist der, den die Reaktion ausgelassen hat.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.