Een hero-titelkaart met de tekst 'Kolibri: een 78B open-weight model uit Duitsland' in grote vetgedrukte letters, met daaronder één kleinere regel met de tekst '78B totaal / 3.46B actief / 1M-tokencontext / Apache 2.0', en drie kleine platte lijniconen op een rij, op een witte achtergrond met zachte blauw-en-cyaan gradientaccenten en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Kolibri's eerste dag: Aleph Alpha opende 78B aan Duits-Engelse gewichten, en de reactie loopt vooruit op het bewijs

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Vierentwintig uur na Aleph Alpha's publicatie van Kolibri, is de reactie verhard tot één enkele regel, en het is de moeite waard die regel uit elkaar te halen. Het Heidelbergse lab zette op 3 oktober 2026 een mixture-of-experts-model met 78,1 miljard parameters op Hugging Face onder Apache 2.0, kondigde het dezelfde ochtend aan in zijn eigen nieuwsruimte en vanaf zijn eigen account, en tegen de volgende dag luidde de samenvatting die in AI-feeds circuleerde: 78B totale parameters, 3,46B actief per token, open gewichten onder Apache 2.0, gebouwd voor Duits en Engels. Elke deelzin van die zin is te controleren aan de hand van de repository. Wat grotendeels onuitgesproken is gebleven, is welke delen van de release gemeten feiten zijn en welke beweringen de auteurs over hun eigen model hebben gedaan, dat niemand buiten Heidelberg heeft gedraaid. Die kloof is het verhaal van dag één, en die is belangrijker dan het getal in de kop.

Begin bij de tijdlijn, want een verrassend groot deel van de reacties behandelde dit als een mysterieuze stille release, en dat was het niet. De Hugging Face-repository Aleph-Alpha/Kolibri-1 werd aangemaakt op 2 oktober 2026 om 05:54:02 UTC, de modelkaart vermeldt een releasedatum van 3 oktober, en het nieuwsbericht van de leverancier verscheen diezelfde ochtend om 08:43:53 GMT — op de Dag van de Duitse Hereniging, een datum die het lab duidelijk had gekozen. Het eigen account van Aleph Alpha plaatste binnen enkele minuten een bericht hierover. Er was geen persembargo en geen lanceringsevenement, wat waarschijnlijk de bron is van de framing 'stille release', maar een nieuwsbericht van een leverancier, een technisch rapport en een officiële aankondiging zijn geen stille release. Het is een normale release waar de algemene AI-pers die dag simpelweg niet over berichtte.

Het getal dat de reactie herhaalt

De reden dat 3,46B actief het cijfer is dat iedereen noemt, is dat het het enige getal in de release is dat verandert wat een koper moet bezitten. Kolibri is een 50-laagse transformer waarin elke laag een mixture-of-experts is, met 384 experts per laag, één gedeeld en zes gerouteerd, over een totaal van 78.103.074.560 parameters. Per token activeert het 3.457.573.120 daarvan — een sparsityratio van ongeveer 22,6 op 1. Dat is wat een model met 78 miljard parameters serveerbaar maakt op een paar H100's in plaats van een rack, en het is de meest ingrijpende bewering in de release.

Rondom staan de andere opvallende cijfers, allemaal van de modelkaart in plaats van uit een onafhankelijke run:

• Context — getraind op 16.384 tokens, mid-getraind op 65.536, native op 262.144, en gevalideerd tot 1.048.576. De kaart raadt aan om op of onder 262.144 te blijven voor latentiegevoelig werk. Let goed op dat het simpele "1M context" dat je in samenvattingen zult zien het gevalideerde plafond is, niet het native venster.

• Precisie — FP8-gewichten in blokken van 128x128 met dynamisch gekwantiseerde activaties, geëvalueerd met een FP8 KV-cache; embeddings, de LM-head, de normalisatielagen en de MoE-router blijven in bfloat16.

• Redeneren — vier inspanningsniveaus — geen, laag, medium, hoog — ingesteld via het chat-template, met tool calling in Hermes-stijl en een vLLM-parser die in dezelfde repository als de gewichten wordt meegeleverd.

• Talen — Duits en Engels, en niets anders.

• Training — 20 biljoen pre-trainingtokens op een gefilterd tweetalig corpus dat ruwweg 62,5 procent Engels, 23,9 procent Duits en 13,6 procent code bevat, plus 3,44 biljoen mid-trainingtokens en 201 miljard voor uitbreiding van de lange context.

• Rekenkracht en energie — 768 NVIDIA B200's verdeeld over 96 HGX-nodes, 21 dagen pre-training gedurende 511 uur en 392.000 GPU-uren bij een gerapporteerde 6,4x10^23 FLOPs, en naar schatting 9,5x10^2 MWh inclusief datacenteroverhead, exclusief gesuperviseerde fine-tuning en reinforcement learning.

• Licentie — Apache 2.0. Geen aanhangsel over aanvaardbaar gebruik, geen drempel voor maandelijks actieve gebruikers, geen afzonderlijke commerciële voorwaarden.

De twee beweringen die niemand heeft gecontroleerd

Dit is het deel van dag één dat de reactie heeft overgeslagen, en het is het deel dat bepaalt of Kolibri belangrijk is of slechts interessant.

Het eerste is de claim over de serveereconomie. De framing van Aleph Alpha is niet dat Kolibri het sterkste model is dat beschikbaar is — op de eigen vergelijkingstabel van het lab is dat niet zo, en dat zegt het lab ook. De framing is dat geen enkel vergeleken model meer kwaliteit levert tegen dezelfde serveerkosten, of dezelfde kwaliteit tegen lagere kosten, langs een Pareto-frontier van kwaliteit afgezet tegen gedecodeerde tokens per seconde per GPU. Dat is een claim over doorvoer op specifieke hardware, en het is precies het soort claim dat alleen een derde partij met een stopwatch en twee H100s kan beslechten. Niemand heeft dat gedaan. Er is geen Artificial Analysis-vermelding voor Kolibri per 4 oktober 2026 en geen replicatie door een derde partij van de evaluatie-opstelling.

Het tweede is de bewering over de tokenizer. Aleph Alpha heeft een tweetalige Duits-Engelse tokenizer met een vocabulaire van 128.000 tokens getraind met een methode die het UniBPE noemt, en rapporteert 4,90 gemiddelde bytes per token op Duitse webtekst tegenover GPT-5 met 4,35, Gemini met 4,13, Qwen 3.5-3.8 met 4,17, GLM 5.3 met 3,93, DeepSeek V4 met 3,72 en Kimi K3 met 3,28. Al die cijfers zijn die van de leverancier zelf, gemeten op het eigen corpus van de leverancier, en vergeleken met concurrenten die de leverancier zelf heeft uitgekozen. Meer tekst per token is eerder een echt effect op de inferentiekosten dan een kwaliteitsclaim, en als het standhoudt, werkt het cumulatief door in elke documentverwerkingsworkload — maar het is de meting van één lab, geen benchmarkresultaat.

Duits is het punt, en het is de meest interessante engineering in de release

De meeste "meertalige" modelkaarten beschrijven een trainingsmix die toevallig Duits bevatte. Deze is net andersom opgebouwd, en de kaart is ongewoon specifiek over de werking.

Kleine proxy-modelexperimenten brachten Aleph Alpha tot een doelstelling van ongeveer 20 procent Duitse data in de mix, wat voor een run van 20 biljoen tokens betekende dat er 4 biljoen Duitse tokens moesten worden gevonden. Ontdubbelde en gefilterde open Duitse datasets leverden 390 miljard op — een orde van grootte te weinig. Het lab dichtte de kloof op drie manieren: het specifiek voor het Duits afstellen van een Common Crawl-filter, wat 1,3 biljoen unieke organische tokens opleverde; het herformuleren van bestaande Duitse documenten tot encyclopedieartikelen, vraag-en-antwoorddialogen en tekstpassages, wat nog eens ongeveer een biljoen opleverde en de grootste Duitse bron werd; en vertaling, die werd gebruikt voor het voorgaande model en bewust werd weggelaten voor Kolibri. Het Duits eindigde als een unieke pool van 2,4 biljoen tokens, waarvan 80 procent in eigen huis was samengesteld of gegenereerd, en werd na upsampeling gezien in 21,3 procent van de pre-trainingstokens.

Het filterdetail is precies het soort ding dat alleen boven water komt in een lab dat daadwerkelijk op Duits heeft getraind. Een standaard pipeline voor taaldata laat documenten met te veel lange woorden vallen — maar Duitse bestuurlijke proza overschrijdt stelselmatig de Engelse grens voor gemiddelde woordlengte, dus standaardinstellingen verwijderen stilletjes het register waarin de overheidsadministratie schrijft. Een model dat op een standaard Engels filter is getraind, heeft vrijwel geen Duits juridisch-bestuurlijk vocabulaire, en geen enkele benchmark zal je dat vertellen.

Wat de vergelijkingstabel daadwerkelijk laat zien

Aleph Alpha heeft een post-trainingvergelijking gepubliceerd die veertien modellen beslaat, en die is nuttiger dan de meeste lanceringstabellen omdat hij het onderwerp niet vleit. Op dezelfde harness, met Kolibri op redeneerinspanning hoog, scoort Qwen3.8 27B 80,2 op het Engelse gemiddelde tegenover 75,5 van Kolibri, en 79,9 op het Duitse gemiddelde tegenover 70,8, en staat het bovenaan bij GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified en beide long-contextbenchmarks. Nemotron 3 Super 120B-A12B scoort 73,0 voor Engels tegenover 75,5 van Kolibri. Gemma 4 26B-A4B IT scoort 71,9 en 66,3 op de twee gemiddelden.

De eerlijke samenvatting van de release is dus niet "state of the art". Het is dat Kolibri zich in het midden bevindt van een veld van modellen die tussen drie en twaalf miljard parameters per token activeren, dat het de veel kleinere duidelijk verslaat, en dat het op de meeste rijen van zijn eigen tabel verliest van een dense model met 27 miljard parameters van Alibaba, terwijl het ongeveer een achtste van de parameters activeert. Of de economische rekensom dat gat goedmaakt, is de Pareto-bewering, en de Pareto-bewering is ongetest.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Hoe je het vandaag eigenlijk zou noemen

Er is geen gehost endpoint van de leverancier — de release bestaat uit gewichten plus een technisch rapport, zonder een Aleph Alpha API-SKU voor Kolibri in het gepubliceerde materiaal. Er is ook geen route voor op OrcaRouter: we hebben de catalogus doorzocht op elke spelling van het leveranciersprefix en de modelnaam, en Kolibri staat er niet in, dus het vandaag aanroepen betekent ongeveer 78 GB aan FP8-gewichten downloaden en zelf een vLLM-endpoint draaien vanuit het aleph-alpha-inference-pakket of de gepubliceerde container-image.

Dat is een echte inkoopbeslissing, geen voetnoot, en dat is waar een routeringslaag zijn bestaansrecht verdient, zelfs voor een model dat ze zelf niet aanbieden. De eerlijke vergelijking voor wie een zelfgehoste soevereine 78B-implementatie overweegt, is niet een rijtje benchmarkresultaten — het is 78 GB VRAM en een inkoopgesprek tegenover een regel per token op hardware die van iemand anders is. Als wat je deze maand werkelijk nodig hebt een klein mixture-of-experts-model is dat je kunt aanroepen zonder twee GPU's te kopen, dan is de Gemma 4 26B-A4B-tier het dichtstbijzijnde dat al op een gerouteerd endpoint staat, voor $0,06 per miljoen invoertokens en $0,33 per miljoen uitvoer met een venster van 262.144 tokens, en OrcaRouter routeert die tier op één OpenAI-compatibele sleutel tegen de lijstprijs van de provider zonder dat er iets bijkomt. Dat is de goedkope manier om erachter te komen of de workload het bezit van de hardware rechtvaardigt voordat de hardware arriveert.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

Waar op te letten, en wat het oordeel zou veranderen

Drie dingen, in volgorde van hoeveel ze het beeld zouden veranderen.

Een onafhankelijke doorvoermeting bij de aanbevolen twee-H100-configuratie van de kaart zou de Pareto-bewering bevestigen of ontkrachten, de enige bewering in de release die echt nieuw is in plaats van een herhaling van een specificatieblad. Een onafhankelijke reproductie van de gemiddelden van de Duitse en Engelse taaksuites zou je vertellen of de kloof met Qwen3.8 27B zo smal is als de eigen tabel van de leverancier suggereert of smaller. En een Duitstalige evaluatie op echte administratieve tekst — niet een vertaalde algemene benchmark — zou testen waar de release daadwerkelijk voor is gebouwd, wat geen enkel leaderboard momenteel meet.

Totdat een van die dingen zich aandient, is de juiste framing die welke de repository zelf ondersteunt. Kolibri is een echte open-weights-release van een Europees lab, op een schaal die Europese labs nog niet eerder hebben geleverd, met Apache 2.0-voorwaarden die geen enkele gevestigde partij evenaarde, een datapijplijn die samen met de weights is gepubliceerd, en een iteratieverhaal met twee modellen dat interessanter is dan het cijfer in de kop. Het is voorlopig ook een model waarvan de meest geciteerde cijfers van de eigen auteurs afkomstig zijn. Beide zinnen zijn vanaf dag één waar, en het is de tweede die de reactie achterwege liet.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.