Ett hero-titelkort med texten "Kolibri: en 78B-modell med öppna vikter från Tyskland" i stor fet stil, med en enda mindre rad nedanför som lyder "78B totalt / 3,46B aktiva / 1M-tokenkontext / Apache 2.0", och tre små platta linjeikoner i rad, placerade på en vit bakgrund med mjuka blå- och cyangradientaccenter och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Kolibris första dag: Aleph Alpha öppnade 78B tyska-engelska vikter, och reaktionen springer före bevisen

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tjugofyra timmar efter att Aleph Alpha publicerade Kolibri, har reaktionen stelnat till en enda rad, och den raden är värd att plocka isär. Heidelberg-labbet lade ut en mixture-of-experts-modell med 78,1 miljarder parametrar på Hugging Face under Apache 2.0 den 3 oktober 2026, tillkännagav den samma morgon i sitt eget nyhetsrum och från sitt eget konto, och dagen därpå löd sammanfattningen som cirkulerade i AI-flöden: 78B totala parametrar, 3,46B aktiva per token, öppna vikter under Apache 2.0, byggd för tyska och engelska. Varje sats i den meningen kan kontrolleras från repositoriet. Vad som till stor del har förblivit osagt är vilka delar av lanseringen som är uppmätta fakta och vilka som är påståenden som författarna gjorde om sin egen modell som ingen utanför Heidelberg har kört. Det gapet är historien från dag ett, och det betyder mer än rubrikens siffra.

Börja med tidslinjen, för en förvånansvärt stor del av reaktionerna behandlade detta som ett mystiskt tyst släpp, och det var det inte. Hugging Face-repositoriet Aleph-Alpha/Kolibri-1 skapades den 2 oktober 2026 kl. 05:54:02 UTC, modellkortet anger ett lanseringsdatum den 3 oktober, och leverantörens inlägg i nyhetsrummet publicerades samma morgon kl. 08:43:53 GMT — på Tyska återföreningsdagen, ett datum som labbet uppenbarligen valde. Aleph Alphas eget konto publicerade ett inlägg om det inom några minuter. Det fanns inget pressembargo och inget lanseringsevenemang, vilket förmodligen är varifrån inramningen "tyst lansering" kom, men ett inlägg i leverantörens nyhetsrum, en teknisk rapport och ett officiellt tillkännagivande är inte ett tyst släpp. De är en normal lansering som den allmänna AI-pressen helt enkelt inte bevakade samma dag.

Numret som reaktionen upprepar

Anledningen till att 3,46B aktiva är den siffra som alla citerar är att det är det enda numret i släppet som förändrar vad en köpare måste äga. Kolibri är en 50-lagers transformer där varje lager är mixture-of-experts, med 384 experter per lager, en delad och sex routade, med totalt 78 103 074 560 parametrar. Per token aktiverar den 3 457 573 120 av dem – en sparsitetskvot på ungefär 22,6 till 1. Det är vad som gör att en modell med 78 miljarder parametrar kan köras på ett par H100:or i stället för ett rack, och det är det enskilt mest betydelsefulla påståendet i släppet.

Runt den sitter de andra huvudsiffrorna, alla från modellkortet snarare än från en oberoende körning:

• Kontext — tränad vid 16 384 tokens, mellantränad vid 65 536, native vid 262 144 och validerad upp till 1 048 576. Kortet rekommenderar att hålla sig på eller under 262 144 för latenskänsligt arbete. Observera noga att den platta "1M-kontext" som du ser i sammanfattningar är det validerade taket, inte det native fönstret.

• Precision — FP8-vikter i 128x128-block med dynamiskt kvantiserade aktiveringar, utvärderade med en FP8 KV-cache; embeddings, LM-huvudet, normerna och MoE-routern förblir i bfloat16.

• Resonemang — fyra ansträngningsnivåer — ingen, låg, medel, hög — som ställs in via chattmallen, med verktygsanrop i Hermes-stil och en vLLM-parser som levereras i samma repository som vikterna.

• Språk — tyska och engelska, och inget annat.

• Träning — 20 biljoner förträningstokens över en filtrerad tvåspråkig korpus som är ungefär 62,5 procent engelska, 23,9 procent tyska och 13,6 procent kod, plus 3,44 biljoner mellanträningstokens och 201 miljarder för långkontextförlängning.

• Beräkningskapacitet och energi – 768 NVIDIA B200:or över 96 HGX-noder, 21 dagars förträning under 511 timmar och 392 000 GPU-timmar vid rapporterade 6,4x10^23 FLOPs, samt uppskattningsvis 9,5x10^2 MWh inklusive datacenter-overhead, exklusive övervakad finjustering och förstärkningsinlärning.

• Licens — Apache 2.0. Ingen tilläggsklausul om godtagbar användning, ingen tröskel för månatligt aktiva användare, inga separata kommersiella villkor.

De två påståendena som ingen har kontrollerat

Det här är den delen av dag ett som reaktionen har hoppat över, och det är den delen som avgör om Kolibri är viktig eller bara intressant.

Det första är påståendet om serveringsekonomi. Aleph Alphas framställning är inte att Kolibri är den starkaste tillgängliga modellen – i labbets egen jämförelsetabell är den inte det, och labbet säger det självt. Framställningen är att ingen jämförd modell levererar högre kvalitet till samma serveringskostnad, eller samma kvalitet till lägre kostnad, längs en Pareto-front för kvalitet mot avkodade tokens per sekund per GPU. Det är ett påstående om genomströmning på specifik hårdvara, och det är precis den sorts påstående som bara en tredje part med ett stoppur och två H100:or kan avgöra. Ingen har gjort det. Det finns ingen Artificial Analysis-post för Kolibri per den 4 oktober 2026 och ingen tredjepartsreplikering av utvärderingsramverket.

Det andra är tokeniserarpåståendet. Aleph Alpha tränade en tvåspråkig tysk-engelsk tokeniserare med ett ordförråd på 128 000 tokens med hjälp av en metod som företaget kallar UniBPE, och rapporterar i genomsnitt 4,90 byte per token på tysk webbtext, mot GPT-5 på 4,35, Gemini på 4,13, Qwen 3.5-3.8 på 4,17, GLM 5.3 på 3,93, DeepSeek V4 på 3,72 och Kimi K3 på 3,28. Var och en av dessa siffror är leverantörens egna, uppmätta på leverantörens egen korpus, mot konkurrenter som leverantören själv valde. Mer text per token är en verklig effekt på inferenskostnaden snarare än ett kvalitetspåstående, och om det håller förstärks det över alla arbetsbelastningar för dokumentbearbetning – men det är ett enda labs mätning, inte ett benchmarkresultat.

Poängen är tyskan, och det är det mest intressanta ingenjörsarbetet i utgåvan.

De flesta ”flerspråkiga” modellkort beskriver en träningsmix som råkade innehålla tyska. Det här är byggt tvärtom, och kortet är ovanligt specifikt om mekaniken.

Små experiment med proxymodeller ledde Aleph Alpha till ett mål på ungefär 20 procent tysk data i mixen, vilket för en körning på 20 biljoner tokens innebar att hitta 4 biljoner tyska tokens. Deduplicerade och filtrerade öppna tyska dataset bidrog med 390 miljarder – en storleksordning för lite. Laboratoriet stängde gapet på tre sätt: genom att trimma om ett Common Crawl-filter specifikt för tyska, vilket gav 1,3 biljoner unika organiska tokens; genom att omformulera befintliga tyska dokument till uppslagsartiklar, fråge- och svarsdialoger och textavsnitt, vilket gav ungefär ytterligare en biljon och blev den enskilt största tyska källan; och genom översättning, som användes för föregångarmodellen och medvetet togs bort för Kolibri. Tyskan slutade som en unik pool på 2,4 biljoner tokens, varav 80 procent kuraterades eller genererades internt, och förekom i 21,3 procent av förträningstokensen efter uppsampling.

Filterdetaljen är en sådan sak som bara dyker upp i ett labb som faktiskt har tränat på tyska. En standardpipeline för språkdata rensar bort dokument med för många långa ord – men tysk förvaltningsprosa överskrider rutinmässigt den engelska gränsen för genomsnittlig ordlängd, så standardinställningar raderar tyst det register som offentlig förvaltning skriver i. En modell som tränats på ett standardmässigt engelskt filter har i stort sett inget tyskt juridiskt-administrativt ordförråd, och ingen benchmark kommer att berätta det för dig.

Vad jämförelsetabellen faktiskt visar

Aleph Alpha har publicerat en jämförelse av efterträning som omfattar fjorton modeller, och den är mer användbar än de flesta lanseringstabeller eftersom den inte smickrar objektet. I samma testrigg med Kolibri vid hög resonemangsansträngning får Qwen3.8 27B 80,2 på det engelska genomsnittet mot Kolibris 75,5, och 79,9 på det tyska genomsnittet mot 70,8, och den leder inom GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified och båda långkontext-benchmarkarna. Nemotron 3 Super 120B-A12B får 73,0 på det engelska genomsnittet mot Kolibris 75,5. Gemma 4 26B-A4B IT får 71,9 och 66,3 på de två genomsnitten.

Så den ärliga sammanfattningen av lanseringen är inte "state of the art". Det är att Kolibri ligger i mitten av ett fält av modeller som aktiverar mellan tre och tolv miljarder parametrar per token, att den klart slår de mycket mindre modellerna, och att den förlorar mot en tät modell med 27 miljarder parametrar från Alibaba på de flesta rader i sin egen tabell medan den aktiverar ungefär en åttondel av parametrarna. Huruvida ekonomin räddar den klyftan är Pareto-påståendet, och Pareto-påståendet är otestat.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Vad du faktiskt skulle kalla det, idag

Det finns ingen hostad slutpunkt från leverantören – utgåvan består av vikter plus en teknisk rapport, utan någon Aleph Alpha API-SKU för Kolibri i det publicerade materialet. Det finns inte heller någon väg för den på OrcaRouter: vi sökte igenom katalogen under varje stavning av leverantörsprefixet och modellnamnet, och Kolibri finns inte där, så att anropa den idag innebär att ladda ner ungefär 78 GB FP8-vikter och köra en vLLM-slutpunkt själv från aleph-alpha-inference paketet eller den publicerade containeravbildningen.

Det är ett verkligt upphandlingsbeslut, inte en fotnot, och det är där ett routningslager förtjänar sin plats även för en modell som det inte tillhandahåller. Den ärliga jämförelsen för den som överväger en självhostad suverän 78B-driftsättning är inte benchmark-rader – det är 78 GB VRAM och ett upphandlingssamtal mot en per-token-kostnadspost på hårdvara som någon annan äger. Om det du faktiskt behöver den här månaden är en liten mixture-of-experts-modell som du kan anropa utan att köpa två GPU:er, är Gemma 4 26B-A4B-nivån det närmaste som redan finns på en routad slutpunkt, till $0.06 per miljon indatatoken och $0.33 per miljon utdata med ett fönster på 262 144 token, och OrcaRouter routar den nivån på en OpenAI-kompatibel nyckel till leverantörens listpris utan något påslag. Det är det billiga sättet att ta reda på om arbetsbelastningen motiverar att äga hårdvaran innan hårdvaran anländer.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

Vad man bör hålla utkik efter, och vad som skulle ändra domen

Tre saker, i ordning efter hur mycket de skulle förändra bilden.

En oberoende genomströmningsmätning i kortets rekommenderade två-H100-konfiguration skulle bekräfta eller vederlägga Pareto-påståendet, vilket är det enda påståendet i pressmeddelandet som är genuint nyskapande snarare än en upprepning av ett specifikationsblad. En oberoende reproduktion av de tyska och engelska uppgiftssviternas medelvärden skulle visa om gapet till Qwen3.8 27B är så smalt som leverantörens egen tabell antyder – eller smalare. Och en tyskspråkig utvärdering på verklig administrativ text – inte ett översatt allmänt riktmärke – skulle pröva det som pressmeddelandet faktiskt byggdes för, vilket ingen resultattavla för närvarande mäter.

Tills ett av dem landar är den korrekta inramningen den som repositoriet självt stöder. Kolibri är ett äkta open-weights-släpp från ett europeiskt labb, i en skala som europeiska labb inte tidigare har levererat, med Apache 2.0-villkor som ingen etablerad aktör matchade, en datapipeline publicerad tillsammans med vikterna, och en historia om två modellers iteration som är mer intressant än rubriksiffran. Det är också, för närvarande, en modell vars mest citerade siffror kommer från dess egna författare. Båda dessa meningar är sanna från dag ett, och den andra är den som reaktionen utelämnade.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.