
Kolibri, förklarat: Aleph Alpha släpper en 78B tysk-engelsk modell under Apache 2.0
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 218 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Aleph Alpha släppte Kolibri den 3 oktober 2026, en mixture-of-experts-modell med 78,1 miljarder parametrar som aktiverar 3,46 miljarder parametrar per token, har ett validerat kontextfönster på 1 048 576 tokens och levereras med fullständiga vikter på Hugging Face under Apache 2.0-licensen. Labbet i Heidelberg publicerade den på Tyska återföreningsdagen, tillsammans med en teknisk rapport, ett modellkort på tyska och engelska samt en ovanligt detaljerad redogörelse för hur modellen tränades. Modellen som den genomgående mäts mot i Aleph Alphas egen dokumentation är Kolibri Origin — föregångaren med 30,6 miljarder parametrar, varav 3,27 miljarder aktiva, som avslutade förträningen den 11 juni 2026 och aldrig släpptes offentligt. Två modeller, tre månader isär, och avståndet mellan dem är det mest intressanta i lanseringen.
Det som gör Kolibri värd en noggrann läsning är inte att det är den starkaste modellen som finns. På Aleph Alphas egna jämförelsetabeller är det inte det, och vi återkommer till det. Det anmärkningsvärda är att ett europeiskt labb överhuvudtaget släppte en modell med öppna vikter i den här skalan, med träningspipen, datahärkomsten och energisiffran publicerade tillsammans med den, och satte licensen till Apache 2.0 i stället för en skräddarsydd forskningslicens. För team vars upphandlingsregler börjar med "var tar datan vägen", är den kombinationen produkten.
Specifikationsbladet, och de två siffrorna som spelar roll
Allt nedan kommer från det modellkort som Aleph Alpha publicerade tillsammans med vikterna; inget av det har ännu reproducerats oberoende, och det finns ingen rad för Kolibri i Artificial Analysis när detta skrivs.
• Totalt antal parametrar — 78 103 074 560, varav 3 457 120 aktiva per token, ett förhållande på ungefär 22,6 till 1.
• Arkitektur — en 50-lagrig transformer, där alla lager är mixture-of-experts, 384 experter per lager med 1 delad och 6 routade, samt en 4:1-blandning av sliding-window-attention och grouped-query-attention genom hela stacken.
• Kontext — tränad vid 16 384 tokens, mellantränad vid 65 536 och utökad till en nativ 262 144. Eftersom positionskodning endast tillämpas i lager med glidande fönster, uppger Aleph Alpha att fönstret kan utökas utan positionsskalning, och har validerat kvalitet och serveringseffektivitet upp till 1 048 576 tokens. Kortet rekommenderar att stanna vid eller under 262 144 för latenskänsligt arbete och för komplexa uppgifter.
• Precision – FP8-vikter i 128×128-block med dynamiskt kvantiserade aktiveringar, utvärderade med en FP8-KV-cache; inbäddningar, LM-huvudet, normaliseringarna och MoE-routern förblir i bfloat16.
• Resonemang — fyra ansträngningsnivåer: ingen, låg, medel och hög, inställda via chattmallen.
• Verktygsanrop — ja, i Hermes-stil, med en vLLM-parser som levereras i samma repository som vikterna.
• Språk — tyska och engelska, och inget annat. Det anges som ett designval snarare än en utelämning.
• Träning — 20 biljoner förtränings-tokens på en filtrerad tvåspråkig korpus, ungefär 62,5 procent engelska, 23,9 procent tyska och 13,6 procent kod, plus 3,44 biljoner mellantränings-tokens och 201 miljarder för långkontextutökning.
• Beräkning — 768 NVIDIA B200:or över 96 HGX-noder, 21 dagars förträning under 511 timmar och 392 000 GPU-timmar, vid rapporterade 6,4×10²³ FLOPs. Mellanträningen tillförde fem dagar och 90 000 GPU-timmar; långkontextförlängningen tillförde 13 timmar och 10 000 GPU-timmar.
• Energi — uppskattningsvis 9,5×10² MWh inklusive overhead för datacenter, avseende förträning, mellanträning och långkontextträning, men exklusive övervakad finjustering och förstärkningsinlärning.
• Licens — Apache 2.0. Ingen tilläggsklausul om godtagbar användning, ingen tröskel för månatligt aktiva användare, inga separata kommersiella villkor.
Två av de raderna är sådana som en köpare bör läsa två gånger. Antalet aktiva parametrar är vad du betalar för vid inferens, och 3,46 miljarder aktiva av totalt 78 miljarder är en aggressiv sparsitetskvot – det är hela anledningen till att en modell av den här storleken överhuvudtaget kan serveras på två GPU:er. Och kontextsiffran anges som 262 144 inbyggd och 1 048 576 validerad, vilket är ett försiktigare påstående än det platta ”1M context” som du kommer att se i den mesta bevakningen av den här lanseringen.

Två modeller, med tre månaders mellanrum
Kolibri är den andra modellen av det som Aleph Alpha kallar sin Model Factory, och tidslinjen som publicerades är den del av lanseringen som de flesta rapporteringar hoppar över.
Arbetet med träningspipelinen började i januari 2026. Kolibri Origin avslutade förträningen vid målskalan den 11 juni 2026 – 30,6 miljarder totala parametrar, 3,27 miljarder aktiva, ett kontextfönster på 65 536 tokens, 7,51 biljoner träningstokens, 50 lager varav två var täta och 48 var MoE, och ett enda resonemangsläge. Den validerades internt och släpptes aldrig offentligt. Kolibri avslutade förträningen den 11 september 2026.
• Parametrar — 30,6B totalt och 3,27B aktiva, mot 78,1B totalt och 3,46B aktiva.
• Kontext — 8 192 tokens förträningskontext på Origin, mot 16 384 på Kolibri, med en nativ kontextlängd på 262 144.
• Data — 7,51 biljoner förträningstokens på Origin, mot 20 biljoner, hämtade från en rå pool på över 200 biljoner som pipelinen filtrerade, deduplicerade och kurerade.
• Arkitektur — två densa lager plus 48 MoE-lager på Origin, mot 50 MoE-lager, med en ändrad uppmärksamhetsdesign, tredubblat expertantal, högre sparsitet och en ersatt routningsalgoritm.
• Resonemang — ett läge på Origin, mot inget, lågt, medel och högt på Kolibri.
• Release – ingen offentlig release för Origin, 3 oktober 2026 för Kolibri.
De siffror som ändras mest är de i uppgiftssviten, där samma utvärderingsramverk poängsatte båda modellerna. På det tyska genomsnittet för efterträningssviten fick Origin 46,4 och Kolibri 70,8; på det engelska genomsnittet 54,1 mot 75,5. På AIME 2025 på tyska: 73,5 mot 87,5. På de interna kundproxy-benchmarkarna som leverantören publicerar som ett vertikalt set gick fordonsleverantörssviten från 0,72 till 0,99, halvledare från 0,35 till 0,80, den tyska offentliga sektorn från 0,54 till 0,75, industriell drivteknik från 0,31 till 0,60 och flyg- och rymdteknik från 0,14 till 0,59.
De där interna vertikala siffrorna drivs av leverantörer på leverantörsbyggda utvärderingssviter som kretsar kring leverantörernas kunder, så behandla dem som en beskrivning av avsikten snarare än en poäng. Poängen med att publicera dem är att de förklarar vad modellen optimerades för: inte en topplista, utan en uppsättning dokument från reglerade branscher.

Tyska är ett designbeslut här, inte en språktagg.
De flesta "flerspråkiga" modellkort betyder en träningsmix som råkade innehålla lite tyska. Det här är byggt på motsatt sätt, och kortet är specifikt om mekaniken.
Aleph Alpha fann genom små experiment med proxy-modeller att omkring 20 procent tyska data i blandningen gav bäst resultat, vilket för en körning på 20 biljoner tokens innebar att hitta 4 biljoner tyska tokens. Deduplicerade och filtrerade öppna tyska datamängder gav företaget 390 miljarder – en tiopotens under målet. Företaget slöt gapet på tre sätt: att ställa om ett Common Crawl-filter specifikt för tyska, vilket gav 1,3 biljoner unika organiska tokens; att omformulera befintliga tyska dokument till uppslagsverksliknande poster, fråge- och svarsdialoger och textavsnitt, vilket gav ungefär 1 biljon till och blev den enskilt största tyska källan; samt översättning, som endast användes i Kolibri Origin och togs bort för Kolibri. Tyskan slutade som en unik pool på 2,4 biljoner tokens, varav 80 procent kuraterades eller genererades internt, och förekom med 21,3 procent av förträningstokens efter uppsampling.
Detaljen i filtret är värd att citera, eftersom det är den typ av sak som bara dyker upp i ett labb som faktiskt har tränat på tyska. En standardpipeline för språkdata kastar dokument med för många långa ord – men tysk förvaltningsprosa överskrider rutinmässigt den engelska gränsen för genomsnittlig ordlängd, så standardinställningarna raderar tyst det register som offentlig förvaltning skriver i. Den uppenbara kommersiella konsekvensen är att en modell som tränats på ett standardfilter för engelska inte har någon nämnvärd tysk juridisk-administrativ vokabulär, och ingen benchmark kommer att berätta det för dig.
Tokeniseraren får samma behandling. Aleph Alpha tränade en tvåspråkig tysk-engelsk tokeniserare med en vokabulär på 128 000 token med hjälp av en ny metod som de kallar UniBPE, vilken behåller bottom-up-sammanslagningen i byte-pair encoding men väljer sammanslagningar med ett unigram-objektiv. På tysk webbtext rapporterar den 4,90 genomsnittliga byte per token, före GPT-5 med 4,35, Gemini med 4,13, Qwen3.5–3.8 med 4,17, GLM 5.3 med 3,93, DeepSeek V4 med 3,72 och Kimi K3 med 3,28 — alla leverantörsrapporterade siffror i leverantörens egen jämförelse. Mer text per token innebär färre token per uppgift, vilket är en direkt effekt på inferenskostnaden snarare än ett kvalitetspåstående, och det är den typ av effektivitetsvinst som ackumuleras över en dokumentbearbetningsarbetsbelastning.
Vad leverantörens tabell inte avgör
Aleph Alpha har publicerat en jämförelse av efterträning som omfattar fjorton modeller, och den är mer användbar än de flesta lanseringstabeller eftersom den inte smickrar subjektet.
På samma testrigg, med Kolibri inställd på hög resonemangsansträngning, får Qwen3.8 27B 80,2 i engelskt genomsnitt mot Kolibris 75,5, och 79,9 i tyskt genomsnitt mot 70,8. Den ligger också före på GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified och de två långkontextbenchmarkarna. Nemotron 3 Super 120B-A12B får 73,0 på engelska mot Kolibris 75,5 – närmare, och ligger före på AIME 2025. Gemma 4 26B-A4B IT får 71,9 och 66,3 på de två genomsnitten.
Så den ärliga sammanfattningen av släppet är inte "state of the art". Det är att Kolibri ligger i mitten av ett fält av modeller som aktiverar mellan tre och tolv miljarder parametrar per token, att den tydligt slår de mycket mindre, och att den förlorar mot en dense modell med 27 miljarder parametrar från Alibaba på de flesta rader i sin egen tabell medan den aktiverar ungefär en åttondel av parametrarna. Aleph Alphas inramning av detta är Paretofronten för kvalitet mot avkodade tokens per sekund per GPU – ingen av de jämförda modellerna levererar mer kvalitet till samma serveringskostnad, eller samma kvalitet till lägre kostnad. Det är det påståendet som bör granskas, och det är ett påstående om serveringsekonomi, inte om förmåga.
Ingen av dessa siffror är oberoende verifierad. Det finns ingen Artificial Analysis-post för Kolibri, ingen tredjepartsreplikering av utvärderingsramverket, och de vertikala benchmarkarna är byggda av leverantören. Jämförelsen är också strukturellt generös mot Kolibri i en riktning och ogenerös i en annan: alla fjorton modeller kördes genom Aleph Alphas egen testram med identiska prompter och few-shot-inställningar, vilket är rätt sätt att göra det på, men det är fortfarande en testram från ett enda labb. Betrakta varje siffra i det här avsnittet som leverantörsrapporterad tills någon annan kör den.

Vad du behöver för att köra det
Kolibri är inte en modell som man testar på en laptop. FP8-vikterna ger ett minnesavtryck för modellen på omkring 78 GB, och kortets minimikrav är två A100 80 GB-kort, två H100 SXM5, en H200, en B200 eller en B300; den rekommenderade konfigurationen är två H100 SXM5, två H200, en B200 eller en B300.
Att servera den innebär att installera paketet aleph-alpha-inference, som tillhandahåller Kolibri vLLM-plugin och låser den vLLM-version som stöds, eller att hämta containeravbildningen ghcr.io/aleph-alpha/aleph-alpha-inference. Därifrån är det ett standardanrop i vLLM med FP8 KV-cache, Kolibri reasoning-parser och Kolibri tool-call-parser. Kontexter över 262 144 tokens kräver en explicit flagga för maximal modellängd och en överstyrning av positionsinbäddningen. De rekommenderade samplingsparametrarna är temperature 1.0, top-p 0.97 och top-k 128.
API-ytan är OpenAI-kompatibel, vilket betyder mer än det låter: reasoning effort skickas genom chattmallen som ett reasoning_effort-värde, och verktygsanrop skickas i standardfältet tools. Ett team som redan talar chat-completions-formatet kan peka befintlig kod mot en Kolibri-endpoint på en maskin i deras egen lokal utan ett wrapper-lager.
Vad Kolibri inte har ännu
Fyra frånvaranden är värda att nämna rakt ut, eftersom lanseringsbevakning brukar hoppa över dem.
• Ingen oberoende utvärdering. Artificial Analysis har ingen modellsida för Kolibri, och ingen tredje part har publicerat en reproduktion av leverantörens benchmarktabell.
• Ingen värdbaserad slutpunkt från leverantören. Släppet består av vikter plus en teknisk rapport; det finns ingen Aleph Alpha API-SKU för Kolibri i materialet som publicerats med modellen.
• Ingen rutt på OrcaRouter, och ingen hos någon aggregator som vi skulle vilja nämna. Vi genomsökte katalogen under varje stavning av leverantörsprefixet och modellnamnet, och Kolibri finns inte där — så om du vill anropa den får du ladda ner 78 GB och köra en vLLM-endpoint själv. Vi säger hellre det än antyder att vi serverar den.
• Ingen multimodal inmatning. Text in, text ut, två språk. Det är avvägningen labbet gjorde för djup framför bredd, och för en driftsättning för dokumentbearbetning är det förmodligen rätt val, men det är en verklig gräns.
Om det du faktiskt behöver i dag är en liten mixture-of-experts-modell som du kan anropa utan att köpa två GPU:er, är Gemma 4 MoE-nivån det närmaste som redan finns på en routad slutpunkt, till $0,06 per miljon indatatoken och $0,33 per miljon utdatatoken för 26B-A4B-varianten, med ett fönster på 262 144 token. För den som väger en självhostad suverän 78B-driftsättning mot det är den användbara jämförelsen inte benchmarkrader — det är 78 GB VRAM och ett inköppssamtal mot en radpost per token.OrcaRouter routar den nivån på en OpenAI-kompatibel nyckel med leverantörens listpris vidarebefordrat och inget tillagt, vilket är det billiga sättet att ta reda på om arbetsbelastningen motiverar att äga hårdvaran.
Kolibri i sig är den mer intressanta artefakten. En tysk-engelsk modell med 78 miljarder parametrar under Apache 2.0, med datapipelinen, tokeniseringsmetoden, energisiffran och en tremånaders iterationshistoria publicerad bredvid vikterna, är ett annat slags släpp än det vanliga viktsläppet – redovisningen är en del av produkten, inte ett blogginlägg om den. Huruvida Pareto-påståendet håller är nu en fråga för personer med två H100:or och ett tidtagarur, och svaret kommer inte att komma från någon som skrev modellkortet.
