
Kolibri, uitgelegd: Aleph Alpha brengt een 78B Duits-Engels model uit onder Apache 2.0
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 218 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Aleph Alpha bracht Kolibri uit op 3 oktober 2026, een mixture-of-experts-model met 78,1 miljard parameters dat 3,46 miljard parameters per token activeert, een gevalideerd contextvenster van 1.048.576 tokens heeft, en wordt geleverd met volledige gewichten op Hugging Face onder de Apache 2.0-licentie. Het Heidelbergse lab publiceerde het op de Dag van de Duitse Hereniging, samen met een technisch rapport, een Duits- en Engelstalige modelkaart, en een ongewoon gedetailleerd verslag van hoe het ding werd getraind. Het model waartegen het in de eigen documentatie van Aleph Alpha steeds wordt afgezet, is Kolibri Origin — de voorganger met 30,6 miljard parameters en 3,27 miljard actieve parameters die de pre-training op 11 juni 2026 afrondde en nooit publiekelijk werd uitgebracht. Twee modellen, drie maanden uit elkaar, en de afstand tussen hen is het interessantste van de release.
Wat Kolibri een zorgvuldige lezing waard maakt, is niet dat het het sterkste beschikbare model is. Op Aleph Alpha's eigen vergelijkingstabellen is dat niet het geval, en daar komen we nog op terug. Wat opmerkelijk is, is dat een Europees lab überhaupt een open-weightmodel op deze schaal heeft uitgebracht, met de trainingspijplijn, de herkomst van de data en het energiecijfer die daarbij gepubliceerd zijn, en de licentie op Apache 2.0 heeft gezet in plaats van een op maat gemaakte onderzoekslicentie. Voor teams wier inkoopregels beginnen met "waar gaat de data naartoe", is die combinatie het product.
Het specificatieblad, en de twee getallen die ertoe doen
Alles hieronder is afkomstig uit de modelkaart die Aleph Alpha samen met de gewichten heeft gepubliceerd; niets ervan is tot nu toe onafhankelijk gereproduceerd, en op het moment van schrijven is er geen Artificial Analysis-rij voor Kolibri.
• Totaal aantal parameters — 78.103.074.560, met 3.457.573.120 actieve per token, een verhouding van ongeveer 22,6 op 1.
• Architectuur — een transformer met 50 lagen, alle lagen mixture-of-experts, 384 experts per laag met 1 gedeelde en 6 gerouteerde, en een 4:1-mix van sliding-window- naar grouped-query-attention over de hele stack.
• Context — getraind op 16.384 tokens, middentraining op 65.536 en uitgebreid naar een native 262.144. Omdat positionele encoding alleen in de sliding-window-lagen wordt toegepast, stelt Aleph Alpha dat het venster kan worden uitgebreid zonder positieschaling, en heeft het de kwaliteit en serveerefficiëntie gevalideerd tot 1.048.576 tokens. De modelkaart raadt aan om op of onder 262.144 te blijven voor latentiegevoelig werk en voor complexe taken.
• Precisie — FP8-gewichten in 128×128-blokken met dynamisch gequantiseerde activaties, geëvalueerd met een FP8-KV-cache; embeddings, de LM-head, de normalisatielagen en de MoE-router blijven in bfloat16.
• Redeneren — vier inspanningsniveaus: geen, laag, gemiddeld en hoog, ingesteld via het chatsjabloon.
• Tool-aanroepen — ja, Hermes-stijl, met een vLLM-parser die in dezelfde repository als de weights wordt meegeleverd.
• Talen — Duits en Engels, en niets anders. Dat wordt als een ontwerpkeuze gepresenteerd, niet als een omissie.
• Training — 20 biljoen pre-trainingtokens op een gefilterd tweetalig corpus, ongeveer 62,5 procent Engels, 23,9 procent Duits en 13,6 procent code, plus 3,44 biljoen mid-trainingtokens en 201 miljard voor uitbreiding van de lange context.
• Rekenkracht — 768 NVIDIA B200's verdeeld over 96 HGX-nodes, 21 dagen pretraining gedurende 511 uur en 392.000 GPU-uren, bij een gerapporteerde 6,4×10²³ FLOPs. Mid-training voegde vijf dagen en 90.000 GPU-uren toe; long-contextuitbreiding voegde 13 uur en 10.000 GPU-uren toe.
• Energie — naar schatting 9,5×10² MWh, inclusief datacenteroverhead, voor pre-training, mid-training en long-contexttraining, maar exclusief supervised fine-tuning en reinforcement learning.
• Licentie — Apache 2.0. Geen aanhangsel over aanvaardbaar gebruik, geen drempel voor maandelijks actieve gebruikers, geen afzonderlijke commerciële voorwaarden.
Twee van die regels zijn de regels die een koper tweemaal zou moeten lezen. Het aantal actieve parameters is waarvoor je bij inferentie betaalt, en 3,46 miljard actief van in totaal 78 miljard is een agressieve sparsiteitsratio — het is de hele reden waarom een model van deze omvang überhaupt op twee GPU's kan worden geserveerd. En de contextwaarde wordt vermeld als 262.144 native met 1.048.576 gevalideerd, wat een zorgvuldigere claim is dan de platte "1M context" die je in de meeste berichtgeving over deze release zult zien.

Twee modellen, drie maanden na elkaar
Kolibri is het tweede model uit wat Aleph Alpha zijn Model Factory noemt, en de tijdlijn die het publiceerde is het onderdeel van de release dat de meeste berichtgeving overslaat.
Het werk aan de trainingspijplijn begon in januari 2026. Kolibri Origin voltooide de pre-training op de beoogde schaal op 11 juni 2026 — 30,6 miljard totale parameters, 3,27 miljard actieve, een contextvenster van 65.536 tokens, 7,51 biljoen trainings-tokens, 50 lagen waarvan er twee dense waren en 48 MoE, en één enkele redeneermodus. Het werd intern gevalideerd en nooit publiekelijk vrijgegeven. Kolibri voltooide de pre-training op 11 september 2026.
• Parameters — 30,6B totaal en 3,27B actief, tegenover 78,1B totaal en 3,46B actief.
• Context — 8.192 tokens aan pre-trainingscontext op Origin, tegenover 16.384 op Kolibri, eindigend op een native 262.144.
• Data — 7,51 biljoen pre-trainingtokens op Origin, tegenover 20 biljoen, geput uit een ruwe pool van meer dan 200 biljoen die de pipeline filterde, dedupliceerde en cureerde.
• Architectuur — twee dense lagen plus 48 MoE-lagen op Origin, tegenover 50 MoE-lagen, met een gewijzigd attention-ontwerp, drie keer zoveel experts, hogere sparsity en een vervangen routing-algoritme.
• Redeneren — één modus op Origin, tegenover geen, laag, gemiddeld en hoog op Kolibri.
• Releasedatum — geen publieke release voor Origin, 3 oktober 2026 voor Kolibri.
De cijfers die het meest verschuiven, zijn die van de taaksuites, waar dezelfde evaluatieopstelling beide modellen beoordeelde. Op het Duitse gemiddelde van de post-trainingssuite scoorde Origin 46,4 en Kolibri 70,8; op het Engelse gemiddelde 54,1 tegen 75,5. Op AIME 2025 in het Duits 73,5 tegen 87,5. Op de interne klantproxy-benchmarks die de leverancier als een verticale set publiceert, ging de automotive-leverancierssuite van 0,72 naar 0,99, halfgeleiders van 0,35 naar 0,80, de Duitse publieke sector van 0,54 naar 0,75, industriële aandrijftechniek van 0,31 naar 0,60 en lucht- en ruimtevaart van 0,14 naar 0,59.
Die interne verticale cijfers worden door leveranciers uitgevoerd op door leveranciers gebouwde evaluatiesuites die zijn toegesneden op de klanten van leveranciers, dus beschouw ze als een beschrijving van de intentie in plaats van een score. Het doel van het publiceren ervan is dat ze uitleggen waarvoor het model is geoptimaliseerd: geen ranglijst, maar een reeks documenten uit gereguleerde sectoren.

Duits is hier een ontwerpbeslissing, geen taaltag.
De meeste 'meertalige' modelkaarten verwijzen naar een trainingsmix die toevallig ook wat Duits bevatte. Deze is juist andersom opgebouwd, en de kaart gaat specifiek in op de mechanica.
Aleph Alpha ontdekte uit kleine proxy-model-experimenten dat ongeveer 20 procent Duitse data in de mix de beste resultaten opleverde, wat voor een run van 20 biljoen tokens betekende dat er 4 biljoen Duitse tokens gevonden moesten worden. Gededupliceerde en gefilterde open Duitse datasets leverden 390 miljard op — een orde van grootte onder het doel. Het bedrijf dichtte de kloof op drie manieren: het opnieuw afstellen van een Common Crawl-filter specifiek voor Duits, wat 1,3 biljoen unieke organische tokens opleverde; het herformuleren van bestaande Duitse documenten in encyclopedie-achtige lemma's, vraag-en-antwoorddialogen en tekstpassages, wat ongeveer 1 biljoen extra opleverde en de grootste Duitse bron werd; en vertaling, alleen gebruikt in Kolibri Origin en geschrapt voor Kolibri. Het Duits eindigde als een unieke pool van 2,4 biljoen tokens, waarvan 80 procent in-house was samengesteld of gegenereerd, goed voor 21,3 procent van de pre-trainingstokens na upsampling.
Het detail over het filter is de moeite waard om te citeren, omdat het het soort ding is dat alleen opduikt in een lab dat daadwerkelijk op Duits heeft getraind. Een standaard pijplijn voor taaldata gooit documenten met te veel lange woorden weg, maar Duitse ambtelijke tekst overschrijdt steevast de Engelse grens voor de gemiddelde woordlengte, dus de standaardinstellingen verwijderen stilletjes het register waarin de overheidsadministratie schrijft. De voor de hand liggende commerciële consequentie is dat een model dat op een standaardfilter voor Engels is getraind, geen noemenswaardige Duitse juridisch-bestuurlijke woordenschat heeft, en geen enkele benchmark zal je dat vertellen.
De tokenizer krijgt dezelfde behandeling. Aleph Alpha trainde een tweetalige Duits-Engelse tokenizer met een vocabulaire van 128.000 tokens met behulp van een nieuwe methode die het UniBPE noemt, waarbij de bottom-up samenvoeging van byte-pair encoding behouden blijft, maar de samenvoegingen worden geselecteerd met een unigram-doelstelling. Op Duitse webtekst rapporteert het 4,90 gemiddelde bytes per token, voor op GPT-5 met 4,35, Gemini met 4,13, Qwen3.5–3.8 met 4,17, GLM 5.3 met 3,93, DeepSeek V4 met 3,72 en Kimi K3 met 3,28 — allemaal door de leverancier gerapporteerde cijfers in de eigen vergelijking van die leverancier. Meer tekst per token betekent minder tokens per taak, wat een direct effect op de inferentiekosten is in plaats van een kwaliteitsclaim, en het is het soort efficiëntiewinst dat zich opstapelt bij een documentverwerkingsworkload.
Wat de tabel van de leverancier niet regelt
Aleph Alpha heeft een post-trainingvergelijking gepubliceerd over veertien modellen, en die is nuttiger dan de meeste lanceringstabellen omdat hij het onderwerp niet flatteert.
Op dezelfde testopstelling, met Kolibri op een hoge redeneerinspanning, scoort Qwen3.8 27B 80,2 op het Engelse gemiddelde tegenover 75,5 van Kolibri, en 79,9 op het Duitse gemiddelde tegenover 70,8. Het leidt ook op GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified en de twee benchmarks voor lange context. Nemotron 3 Super 120B-A12B scoort 73,0 op Engels tegenover 75,5 van Kolibri — dichterbij, en voorop bij AIME 2025. Gemma 4 26B-A4B IT scoort 71,9 en 66,3 op de twee gemiddelden.
Dus de eerlijke samenvatting van de release is niet "state of the art". Het is dat Kolibri zich in het midden bevindt van een veld van modellen die tussen de drie en twaalf miljard parameters per token activeren, dat het de veel kleinere duidelijk verslaat, en dat het op de meeste rijen van zijn eigen tabel verliest van een dense model met 27 miljard parameters van Alibaba, terwijl het ongeveer een achtste van de parameters activeert. De framing die Aleph Alpha daarvoor hanteert, is de Pareto-grens van kwaliteit tegenover gedecodeerde tokens per seconde per GPU — geen van de vergeleken modellen levert meer kwaliteit bij dezelfde serveerkosten, of dezelfde kwaliteit tegen lagere kosten. Dat is de claim die bevraagd moet worden, en het is een claim op het gebied van serveereconomie, geen capaciteitsclaim.
Geen van deze cijfers is onafhankelijk geverifieerd. Er is geen Artificial Analysis-vermelding voor Kolibri, geen replicatie van het evaluatieraamwerk door derden, en de verticale benchmarks zijn door de leverancier gebouwd. De vergelijking is ook structureel gunstig voor Kolibri in de ene richting en ongunstig in de andere: alle veertien modellen werden via Aleph Alpha's eigen harness gedraaid met identieke prompts en few-shot-instellingen, wat de juiste manier is om het te doen, maar het blijft de harness van één lab. Behandel elk getal in deze sectie als door de leverancier gerapporteerd totdat iemand anders het uitvoert.

Wat je nodig hebt om het te draaien
Kolibri is geen model dat je op een laptop uitprobeert. De FP8-gewichten zorgen voor een geheugenvoetafdruk van het model van ongeveer 78 GB, en het minimum voor de kaart is twee A100 80 GB-kaarten, twee H100 SXM5's, één H200, één B200 of één B300; de aanbevolen configuratie is twee H100 SXM5's, twee H200's, één B200 of één B300.
Het serveren ervan betekent het installeren van het pakket aleph-alpha-inference, dat de Kolibri vLLM-plugin levert en de ondersteunde vLLM-versie vastzet, of het ophalen van de containerimage ghcr.io/aleph-alpha/aleph-alpha-inference. Vanaf daar is het een standaard vLLM-aanroep met de FP8 KV-cache, de Kolibri reasoning-parser en de Kolibri tool-call-parser. Contexten van meer dan 262.144 tokens vereisen een expliciete maximum-model-length-flag en een override voor positie-embeddings. De aanbevolen samplingparameters zijn temperature 1.0, top-p 0.97 en top-k 128.
Het API-oppervlak is OpenAI-compatibel, wat belangrijker is dan het klinkt: reasoning effort wordt via de chat-template doorgegeven als een reasoning_effort-waarde, en tool calls worden in het standaard tools-veld gegenereerd. Een team dat het chat-completions-formaat al spreekt, kan bestaande code op een Kolibri-endpoint op een machine in hun eigen gebouw richten zonder wrapperlaag.
Wat Kolibri nog niet heeft
Vier afwezigheden zijn het waard om ronduit te benoemen, omdat de verslaggeving rond de lancering ze doorgaans overslaat.
• Geen onafhankelijke evaluatie. Artificial Analysis heeft geen modelpagina voor Kolibri, en geen enkele derde partij heeft een reproductie van de benchmarktabel van de leverancier gepubliceerd.
• Geen door de leverancier gehoste endpoint. De release bestaat uit gewichten plus een technisch rapport; er is geen Aleph Alpha API-SKU voor Kolibri in het materiaal dat bij het model is gepubliceerd.
• Geen route op OrcaRouter, en geen enkele op een aggregator die wij zouden noemen. We hebben de catalogus doorzocht onder elke spelling van het leveranciersvoorvoegsel en de modelnaam, en Kolibri staat er niet — dus als je het wilt aanroepen, download je 78 GB en draai je zelf een vLLM-endpoint. Dat zeggen we liever dan te suggereren dat we het aanbieden.
• Geen multimodale invoer. Tekst in, tekst uit, twee talen. Dat is de afweging die het lab heeft gemaakt om diepgang boven breedte te verkiezen, en voor een implementatie gericht op documentverwerking is het waarschijnlijk de juiste, maar het is een echte grens.
Als wat je vandaag daadwerkelijk nodig hebt een klein mixture-of-experts-model is dat je kunt aanroepen zonder twee GPU's te kopen, is de Gemma 4 MoE-tier het dichtstbijzijnde dat al op een gerouteerd endpoint staat, voor $0,06 per miljoen inputtokens en $0,33 per miljoen outputtokens bij de 26B-A4B-variant, met een venster van 262.144 tokens. Voor wie een zelfgehoste 78B-soevereine deployment daartegen afweegt, is de nuttige vergelijking niet rijen met benchmarks — het is 78 GB VRAM en een inkoopgesprek tegenover een kostenpost per token. OrcaRouter routeert die tier op één OpenAI-compatibele sleutel, met de lijstprijs van de provider doorgegeven en niets erbovenop, wat de goedkope manier is om erachter te komen of de workload het bezit van de hardware rechtvaardigt.
Kolibri zelf is het interessantere artefact. Een Duits-Engels model met 78 miljard parameters onder Apache 2.0, waarbij de datapijplijn, de tokenizer-methode, het energiecijfer en een verhaal over drie maanden iteratie naast de gewichten zijn gepubliceerd, is een ander soort release dan de gebruikelijke gewichten-drop — de openbaarmaking is deel van het product, niet een blogpost erover. Of de Pareto-claim standhoudt, is nu een vraag voor mensen met twee H100's en een stopwatch, en het antwoord zal niet komen van iemand die de modelkaart heeft geschreven.
