
Kolibri, erklärt: Aleph Alpha veröffentlicht ein 78B-Deutsch-Englisch-Modell unter Apache 2.0
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 218 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Aleph Alpha veröffentlichte Kolibri am 3. Oktober 2026, ein Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern, das pro Token 3,46 Milliarden Parameter aktiviert, ein validiertes Kontextfenster von 1.048.576 Token besitzt und mit vollständigen Gewichten auf Hugging Face unter der Apache-2.0-Lizenz ausgeliefert wird. Das Heidelberger Labor veröffentlichte es am Tag der Deutschen Einheit, zusammen mit einem technischen Bericht, einer deutsch- und englischsprachigen Modellkarte und einer ungewöhnlich detaillierten Darstellung davon, wie das Modell trainiert wurde. Das Modell, an dem es in der gesamten Dokumentation von Aleph Alpha gemessen wird, ist Kolibri Origin — der 30,6 Milliarden Parameter große Vorgänger mit 3,27 Milliarden aktiven Parametern, der am 11. Juni 2026 das Pre-Training abschloss und nie öffentlich veröffentlicht wurde. Zwei Modelle, drei Monate Abstand, und der Abstand zwischen ihnen ist das Interessanteste an der Veröffentlichung.
Was Kolibri einen genauen Blick wert macht, ist nicht, dass es das stärkste verfügbare Modell ist. In Aleph Alphas eigenen Vergleichstabellen ist es das nicht, und darauf kommen wir noch zu sprechen. Bemerkenswert ist, dass ein europäisches Labor überhaupt ein Modell mit offenen Gewichten in dieser Größenordnung veröffentlicht hat – einschließlich der dazu veröffentlichten Trainingspipeline, der Datenherkunft und der Energieverbrauchszahl – und die Lizenz auf Apache 2.0 statt auf eine maßgeschneiderte Forschungs-Lizenz gesetzt hat. Für Teams, deren Beschaffungsregeln mit „Wohin gehen die Daten?“ beginnen, ist genau diese Kombination das Produkt.
Das Datenblatt, und die zwei Zahlen, auf die es ankommt
Alles unten Stehende stammt aus der Modellkarte, die Aleph Alpha zusammen mit den Gewichten veröffentlicht hat; nichts davon wurde bislang unabhängig reproduziert, und zum Zeitpunkt des Verfassens gibt es keine Artificial-Analysis-Zeile für Kolibri.
• Gesamtparameter — 78.103.074.560, davon 3.457.573.120 pro Token aktiv, ein Verhältnis von etwa 22,6 zu 1.
• Architektur — ein 50-schichtiger Transformer, alle Schichten Mixture-of-Experts, 384 Experten pro Schicht mit 1 gemeinsam genutzten und 6 gerouteten sowie einer 4:1-Mischung aus Sliding-Window- und Grouped-Query-Attention über den gesamten Stack.
• Kontext — trainiert mit 16.384 Tokens, im Mid-Training auf 65.536 und auf native 262.144 erweitert. Da die Positionskodierung nur in den Sliding-Window-Schichten angewendet wird, gibt Aleph Alpha an, dass das Fenster ohne Positionsskalierung erweitert werden kann, und hat Qualität und Serving-Effizienz bis zu 1.048.576 Tokens validiert. Die Modellkarte empfiehlt, bei latenzempfindlichen Arbeiten und bei komplexen Aufgaben bei oder unter 262.144 zu bleiben.
• Präzision — FP8-Gewichte in 128×128-Blöcken mit dynamisch quantisierten Aktivierungen, ausgewertet mit einem FP8-KV-Cache; Embeddings, der LM-Head, die Normalisierungsschichten und der MoE-Router bleiben in bfloat16.
• Reasoning — vier Aufwandsstufen (keine, niedrig, mittel und hoch), festgelegt über die Chat-Vorlage.
• Tool-Aufruf — ja, im Hermes-Stil, mit einem vLLM-Parser, der im selben Repository wie die Gewichte ausgeliefert wird.
• Sprachen — Deutsch und Englisch, und sonst nichts. Das ist als Designentscheidung und nicht als Auslassung angegeben.
• Training — 20 Billionen Pre-Training-Tokens auf einem gefilterten bilingualen Korpus, etwa 62,5 Prozent Englisch, 23,9 Prozent Deutsch und 13,6 Prozent Code, plus 3,44 Billionen Mid-Training-Tokens und 201 Milliarden für die Long-Context-Erweiterung.
• Rechenleistung — 768 NVIDIA B200s über 96 HGX-Knoten, 21 Tage Vortraining für 511 Stunden und 392.000 GPU-Stunden, bei berichteten 6,4×10²³ FLOPs. Mitteltraining fügte fünf Tage und 90.000 GPU-Stunden hinzu; Long-Context-Erweiterung fügte 13 Stunden und 10.000 GPU-Stunden hinzu.
• Energie — geschätzte 9,5×10² MWh einschließlich Data-Center-Overhead, abdeckend Pre-Training, Mid-Training und Long-Context-Training, aber ohne überwachtes Fine-Tuning und Reinforcement Learning.
• Lizenz — Apache 2.0. Keine Zusatzklausel zur akzeptablen Nutzung, keine Schwelle für monatlich aktive Nutzer, keine gesonderten kommerziellen Bedingungen.
Zwei dieser Zeilen sind die, die ein Käufer zweimal lesen sollte. Die Anzahl der aktiven Parameter ist das, wofür man bei der Inferenz bezahlt, und 3,46 Milliarden aktive von insgesamt 78 Milliarden sind ein aggressives Sparsity-Verhältnis – es ist der eigentliche Grund, warum ein Modell dieser Größe überhaupt auf zwei GPUs bereitgestellt werden kann. Und die Kontextangabe wird als 262.144 native, 1.048.576 validiert genannt, was eine sorgfältigere Aussage ist als das pauschale „1M-Kontext“, das man in den meisten Berichten zu dieser Veröffentlichung sehen wird.

Zwei Modelle, drei Monate Abstand
Kolibri ist das zweite Modell aus dem, was Aleph Alpha seine Model Factory nennt, und die Zeitleiste, die es veröffentlicht hat, ist der Teil der Veröffentlichung, den die meisten Berichte überspringen.
Die Arbeit an der Trainingspipeline begann im Januar 2026. Kolibri Origin schloss das Pre-Training im Zielmaßstab am 11. Juni 2026 ab – 30,6 Milliarden Parameter insgesamt, 3,27 Milliarden aktive, ein Kontextfenster von 65.536 Tokens, 7,51 Billionen Trainings-Tokens, 50 Schichten, von denen zwei dicht und 48 MoE waren, sowie ein einziger Reasoning-Modus. Es wurde intern validiert und nie öffentlich veröffentlicht. Kolibri schloss das Pre-Training am 11. September 2026 ab.
• Parameter — 30,6 Mrd. gesamt und 3,27 Mrd. aktiv, gegenüber 78,1 Mrd. gesamt und 3,46 Mrd. aktiv.
• Kontext — 8.192 Tokens Vortrainingskontext auf Origin, gegenüber 16.384 auf Kolibri, endend bei nativen 262.144.
• Daten — 7,51 Billionen Pre-Training-Tokens auf Origin, gegenüber 20 Billionen, aus einem Rohpool von mehr als 200 Billionen gewonnen, den die Pipeline gefiltert, dedupliziert und kuratiert hat.
• Architektur — zwei dichte Schichten plus 48 MoE-Schichten auf Origin, gegenüber 50 MoE-Schichten, mit einem geänderten Attention-Design, dreifacher Expertanzahl, höherer Sparsity und einem ersetzten Routing-Algorithmus.
• Reasoning — ein Modus auf Origin, gegenüber keinem, niedrig, mittel und hoch auf Kolibri.
• Release — keine öffentliche Veröffentlichung für Origin, 3. Oktober 2026 für Kolibri.
Am stärksten verändern sich die Zahlen der Task-Suite, bei der dasselbe Eval-Harness beide Modelle bewertete. Im deutschen Durchschnitt der Post-Training-Suite erzielte Origin 46,4 und Kolibri 70,8; im englischen Durchschnitt 54,1 gegenüber 75,5. Bei AIME 2025 auf Deutsch 73,5 gegenüber 87,5. Bei den internen Customer-Proxy-Benchmarks, die der Anbieter als vertikales Set veröffentlicht, ging die Automobilzulieferer-Suite von 0,72 auf 0,99, Halbleiter von 0,35 auf 0,80, der deutsche öffentliche Sektor von 0,54 auf 0,75, industrielle Antriebstechnik von 0,31 auf 0,60 und die Luft- und Raumfahrt von 0,14 auf 0,59.
Diese internen branchenspezifischen Zahlen werden von Anbietern auf anbietereigenen Evaluations-Suiten erhoben, die auf die Kunden der Anbieter zugeschnitten sind. Betrachten Sie sie daher als Beschreibung der Absicht und nicht als Punktzahl. Der Sinn ihrer Veröffentlichung liegt darin, dass sie erklären, worauf das Modell optimiert wurde: nicht auf eine Bestenliste, sondern auf eine Reihe von Dokumenten aus regulierten Branchen.

Deutsch ist hier eine Design-Entscheidung, kein Sprach-Tag.
Die meisten „mehrsprachigen“ Modellkarten stehen für einen Trainingsmix, der zufällig auch etwas Deutsch enthielt. Diese hier ist genau umgekehrt aufgebaut, und die Karte ist sehr genau, was die Mechanismen angeht.
Aleph Alpha fand durch kleine Experimente mit Proxy-Modellen heraus, dass rund 20 Prozent deutsche Daten in der Mischung die besten Ergebnisse erzielten, was für einen Lauf mit 20 Billionen Token bedeutete, 4 Billionen deutsche Token finden zu müssen. Deduplizierte und gefilterte offene deutsche Datensätze lieferten 390 Milliarden – eine Größenordnung unter dem Ziel. Die Lücke schloss es auf drei Wegen: durch die Neujustierung eines Common-Crawl-Filters speziell für Deutsch, was 1,3 Billionen einzigartige organische Token hervorbrachte; durch die Umformulierung bestehender deutscher Dokumente in enzyklopädieartige Einträge, Frage-und-Antwort-Dialoge und Textpassagen, was etwa 1 Billion weitere ergab und zur größten einzelnen deutschen Quelle wurde; und durch Übersetzung, die nur in Kolibri Origin verwendet und für Kolibri fallengelassen wurde. Deutsch bildete am Ende einen einzigartigen Pool von 2,4 Billionen Token, zu 80 Prozent intern kuratiert oder generiert, auf den nach dem Upsampling 21,3 Prozent der Pre-Training-Token entfielen.
Das Filterdetail ist es wert, zitiert zu werden, weil es die Art von Sache ist, die nur in einem Labor auftaucht, das tatsächlich auf Deutsch trainiert hat. Eine Standard-Pipeline für Sprachdaten verwirft Dokumente mit zu vielen langen Wörtern – doch deutsche Verwaltungsprosa überschreitet regelmäßig die englische Grenze für die durchschnittliche Wortlänge, sodass die Standardeinstellungen stillschweigend das Sprachregister löschen, in dem die öffentliche Verwaltung schreibt. Die offensichtliche kommerzielle Folge ist, dass ein Modell, das mit einem Standard-englischen Filter trainiert wurde, so gut wie kein deutsches rechts- und verwaltungssprachliches Vokabular hat, und kein Benchmark wird Ihnen das sagen.
Der Tokenizer erhält dieselbe Behandlung. Aleph Alpha hat einen bilingualen deutsch-englischen Tokenizer mit einem Vokabular von 128.000 Tokens trainiert, und zwar mit einer neuen Methode, die das Unternehmen UniBPE nennt. Sie behält das Bottom-up-Merging des Byte-Pair-Encoding bei, wählt die Merges aber anhand eines Unigramm-Ziels aus. Auf deutschem Webtext meldet das Unternehmen durchschnittlich 4,90 Bytes pro Token, vor GPT-5 mit 4,35, Gemini mit 4,13, Qwen3.5–3.8 mit 4,17, GLM 5.3 mit 3,93, DeepSeek V4 mit 3,72 und Kimi K3 mit 3,28 — alles vom Anbieter gemeldete Zahlen aus dem eigenen Vergleich des Anbieters. Mehr Text pro Token bedeutet weniger Tokens pro Aufgabe, was ein direkter Inferenzkosteneffekt und keine Qualitätsaussage ist, und es ist die Art von Effizienzgewinn, der sich über einen Workload zur Dokumentenverarbeitung hinweg summiert.
Was die Tabelle des Anbieters nicht klärt
Aleph Alpha hat einen Post-Training-Vergleich veröffentlicht, der vierzehn Modelle abdeckt, und er ist nützlicher als die meisten Launch-Tabellen, weil er den Gegenstand nicht beschönigt.
Auf demselben Harness erreicht Qwen3.8 27B, wobei Kolibri auf Reasoning-Aufwand hoch eingestellt ist, 80,2 im englischen Durchschnitt gegenüber 75,5 von Kolibri und 79,9 im deutschen Durchschnitt gegenüber 70,8. Außerdem führt es bei GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified und den beiden Long-Context-Benchmarks. Nemotron 3 Super 120B-A12B erreicht 73,0 im Englischen gegenüber 75,5 von Kolibri – näher dran und vorn bei AIME 2025. Gemma 4 26B-A4B IT erreicht 71,9 und 66,3 in den beiden Durchschnitten.
Die ehrliche Zusammenfassung des Releases ist also nicht „State of the Art“. Sie lautet vielmehr, dass Kolibri mitten in einem Feld von Modellen steht, die pro Token zwischen drei und zwölf Milliarden Parameter aktivieren, dass es die deutlich kleineren klar schlägt und dass es gegen ein dichtes Modell von Alibaba mit 27 Milliarden Parametern in den meisten Zeilen seiner eigenen Tabelle verliert, während es ungefähr ein Achtel der Parameter aktiviert. Aleph Alphas Rahmung dafür ist die Pareto-Grenze von Qualität gegenüber dekodierten Tokens pro Sekunde pro GPU – keines der verglichenen Modelle liefert mehr Qualität bei gleichen Serving-Kosten oder die gleiche Qualität bei niedrigeren Kosten. Das ist die Behauptung, die es zu hinterfragen gilt, und es ist eine Behauptung zur Serving-Ökonomie, keine Fähigkeitsbehauptung.
Keine dieser Zahlen ist unabhängig verifiziert. Es gibt keinen Eintrag bei Artificial Analysis für Kolibri, keine Replikation des Eval-Frameworks durch Dritte, und die vertikalen Benchmarks wurden vom Anbieter erstellt. Der Vergleich ist außerdem strukturell in die eine Richtung großzügig gegenüber Kolibri und in die andere wenig großzügig: Alle vierzehn Modelle liefen durch Aleph Alphas eigenen Harness mit identischen Prompts und Few-Shot-Einstellungen, was der richtige Weg ist, aber es ist immer noch der Harness eines einzelnen Labors. Behandeln Sie jede Zahl in diesem Abschnitt als vom Anbieter angegeben, bis jemand anderes die Tests selbst durchführt.

Was Sie zum Ausführen benötigen
Kolibri ist kein Modell, das man auf einem Laptop ausprobiert. Die FP8-Gewichte haben einen Modellspeicherbedarf von etwa 78 GB, und die Mindestanforderung an Karten besteht aus zwei A100 80 GB Karten, zwei H100 SXM5, einer H200, einer B200 oder einer B300; die empfohlene Konfiguration besteht aus zwei H100 SXM5, zwei H200, einer B200 oder einer B300.
Um es bereitzustellen, muss man das Paket aleph-alpha-inference installieren, das das Kolibri-vLLM-Plugin bereitstellt und die unterstützte vLLM-Version fixiert, oder das Container-Image ghcr.io/aleph-alpha/aleph-alpha-inference ziehen. Von dort aus ist es ein standardmäßiger vLLM-Aufruf mit dem FP8-KV-Cache, dem Kolibri-Reasoning-Parser und dem Kolibri-Tool-Call-Parser. Kontexte über 262.144 Token benötigen ein explizites Maximum-Model-Length-Flag und eine Überschreibung des Position-Embeddings. Die empfohlenen Sampling-Parameter sind Temperatur 1,0, Top-p 0,97 und Top-k 128.
Die API-Oberfläche ist OpenAI-kompatibel, was wichtiger ist, als es klingt: Reasoning Effort wird über das Chat-Template als reasoning_effort-Wert übergeben, und Tool-Aufrufe werden im standardmäßigen tools-Feld ausgegeben. Ein Team, das bereits das Chat-Completions-Format spricht, kann vorhandenen Code auf einen Kolibri-Endpunkt auf einem Rechner im eigenen Gebäude richten, ohne eine Wrapper-Schicht.
Was Kolibri noch nicht hat
Vier Auslassungen sollten ausdrücklich genannt werden, weil die Launch-Berichterstattung sie gewöhnlich überspringt.
• Keine unabhängige Bewertung. Artificial Analysis hat keine Modellseite für Kolibri, und kein Dritter hat eine Reproduktion der Benchmark-Tabelle des Anbieters veröffentlicht.
• Kein gehosteter Endpoint vom Anbieter. Das Release umfasst Gewichte plus einen technischen Bericht; im mit dem Modell veröffentlichten Material gibt es keine Aleph Alpha API-SKU für Kolibri.
• Keine Route auf OrcaRouter und keine bei irgendeinem Aggregator, den wir nennen würden. Wir haben den Katalog unter jeder Schreibweise des Anbieterpräfixes und des Modellnamens durchsucht, und Kolibri ist dort nicht vorhanden — wenn du es also aufrufen willst, lädst du 78 GB herunter und betreibst selbst einen vLLM-Endpunkt. Wir sagen das lieber, als anzudeuten, dass wir es bereitstellen.
• Keine multimodale Eingabe. Text rein, Text raus, zwei Sprachen. Das ist der Kompromiss, den das Labor eingegangen ist – Tiefe statt Breite –, und für einen Einsatz in der Dokumentenverarbeitung ist er wahrscheinlich der richtige, aber es ist eine echte Grenze.
Wenn Sie heute tatsächlich ein kleines Mixture-of-Experts-Modell brauchen, das Sie aufrufen können, ohne zwei GPUs zu kaufen, dann ist die Gemma 4 MoE-Stufe das Nächstliegende, das bereits auf einem gerouteten Endpoint verfügbar ist – bei 0,06 $ pro Million Input-Token und 0,33 $ pro Million Output-Token auf der 26B-A4B-Variante, mit einem Kontextfenster von 262.144 Token. Für alle, die eine selbst gehostete souveräne 78B-Bereitstellung damit abwägen, ist der nützliche Vergleich nicht die Benchmark-Zeilen – sondern 78 GB VRAM und ein Beschaffungsgespräch gegen einen Pro-Token-Einzelposten. OrcaRouter routet diese Stufe über einen einzigen OpenAI-kompatiblen Schlüssel, wobei der Listenpreis des Anbieters durchgereicht und nichts aufgeschlagen wird, was der günstige Weg ist, um herauszufinden, ob die Workload den Besitz der Hardware rechtfertigt.
Kolibri selbst ist das interessantere Artefakt. Ein deutsch-englisches Modell mit 78 Milliarden Parametern unter Apache 2.0, bei dem die Datenpipeline, die Tokenizer-Methode, die Energieangabe und eine dreimonatige Iterationsgeschichte neben den Gewichten veröffentlicht wurden, ist eine andere Art von Veröffentlichung als die übliche Veröffentlichung von Gewichten – die Offenlegung ist Teil des Produkts, nicht ein Blogbeitrag darüber. Ob die Pareto-Behauptung standhält, ist jetzt eine Frage für Leute mit zwei H100s und einer Stoppuhr, und die Antwort wird nicht von jemandem kommen, der die Modellkarte geschrieben hat.
