
Kolibri mot Gemma 4 12B: 78 miljarder parametrar mot 12, och bara en av dem har en poäng
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 218 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Kolibri och Gemma 4 12B är de två ändarna av ett spektrum som släpp med öppna vikter vanligtvis inte låter dig jämföra på lika villkor. Aleph Alphas Kolibri släpptes den 3 oktober 2026: 78,1 miljarder totala parametrar, 3,46 miljarder aktiva per token, ett validerat kontextfönster på 1 048 576 token, endast tyska och engelska, Apache 2.0. Gemma 4 12B släpptes den 3 juni 2026: 11,95 miljarder täta parametrar, ett kontextfönster på 262 144 token, text-, bild-, ljud- och videoinmatning, Apache 2.0. En av dem har ett oberoende, offentligt reproducerbart resultat. Den andra har en leverantörs benchmarktabell. Den asymmetrin är inte en fotnot till den här jämförelsen; den är jämförelsen, eftersom allt annat en köpare bryr sig om – kostnad per uppgift, kvalitet per watt, om det kommer att fungera på dina dokument – går genom den.
Vi bör vara lika rakt på sak om hur matchningen ser ut, för en rubrik som ställer en 78B-modell mot en 12B-modell inbjuder till fel slutsats. De är inte konkurrenter. Den ena är en driftsättning på 78 GB inriktad på dokumentarbete inom tysk offentlig sektor och industrin på rack som kunden äger; den andra är en enhetlig multimodal modell med 12 miljarder parametrar som körs på en laptop och har ett oberoende index på 14. Det som följer är en redogörelse för vad var och en faktiskt är till för, var de publicerade siffrorna tillåter och inte tillåter att du rangordnar dem, och vad det kostar att inte ha en oberoende poäng.
Den enda siffran du kan lita på här, och den du inte kan.
Artificial Analysis har mätt Gemma 4 12B i dess resonemangskonfiguration. Resultaten, såsom de publicerats på deras modellsida, är de som ska ligga till grund för arbetet:
• Intelligens — ett Artificial Analysis Intelligence Index på 14, vilket placerar den i toppklassbandet med en #21-position bland de 142 modellerna i den jämförelsen, mot en median på 8 för jämförbara modeller.
• Hastighet — 112,5 utdatatoken per sekund, #21 av 142 i hastighetsvyn, och över medianen på 91 token för jämförbara modeller.
• Pris — 0,10 USD per miljon indatatoken och 0,30 USD per miljon utdatatoken, vilket deras sida framhåller som något dyrt jämfört med en median på 0,03 USD och 0,15 USD för modeller av liknande storlek och klass.
• Specifikation — kontext på 262 144 token, 12B parametrar totalt, Apache 2.0, text-, bild-, tal- och videoinmatning, textutmatning.
Artificial Analysis eget sammanfattande omdöme är ovanligt rakt på sak för att vara en topplistesida, och värt att upprepa: Gemma 4 12B är bland de ledande modellerna i intelligens men något dyr jämfört med andra modeller med öppna vikter av liknande storlek. Det är en verklig, oberoende, reproducerbar bedömning från en tredje part som inte har något intresse i någon av leverantörerna.
Kolibri har inget motsvarande. Det finns ingen modellsida för Kolibri hos Artificial Analysis, och när detta skrivs har ingen tredje part reproducerat utvärderingssviten. Det som finns är Aleph Alphas egen jämförelsetabell, där Kolibri får 75,5 i engelskt genomsnitt och 70,8 i tyskt genomsnitt över sin uppgiftssvit. Det är oviktade procentgenomsnitt över en blandning av benchmarks som leverantören valt, på ett testramverk som leverantören har skrivit, med reasoning effort inställt på high. De är inte ett Intelligence Index, och de två siffrorna kan inte konverteras till varandra eller ställas sida vid sida. Den som presenterar ”Kolibri 75,5 mot Gemma 14” som en rangordning jämför en procentandel på en skala med en poäng på en annan. Den ärliga hållningen är att Gemma 4 12B:s kvalitet är uppmätt och Kolibris är hävdad.
Det som leverantörstabellen faktiskt låter dig göra är att läsa tvärs över rader. Gemma 4 26B-A4B IT, Googles egen mixture-of-experts-syskonmodell till 12B, finns i Aleph Alphas tabell med 71,9 på engelska och 66,3 på tyska, under Kolibri på båda. Det är det närmaste en korsverifiering som finns, och det kommer med samma förbehåll: leverantörens testramverk, leverantörens siffror. Det är en svag signal, inte ett bevis.

Dense 12B mot sparse 78B är inte den obalans det ser ut som
Arkitekturgapet är större än parametergapet när man väl tar hänsyn till vad som faktiskt beräknas per token.
• Beräkning per token — Gemma 4 12B aktiverar alla 11,95 miljarder parametrar för varje token. Kolibri aktiverar 3 457 573 120 av sina 78 103 074 560, ungefär en tjugoandra del av modellen, med en delad expert och sex routade experter per lager av 384.
• Minne — avvägningen går åt andra hållet och den är brutal. Gemma 4 12B i bfloat16 ligger i storleksordningen 24 GB vikter. Kolibris kort anger FP8-vikterna till ungefär 78 GB, med minst två A100 80 GB-kort, två H100 SXM5, ett H200, ett B200 eller ett B300.
• Attention — Gemma 4 använder en hybrid av lokal sliding-window-attention och full global attention, med det sista lagret alltid globalt. Kolibri använder en 4:1-fördelning mellan sliding-window och grouped-query över 50 lager som alla är MoE.
• Kontext — 262 144 tokens för Gemma 4 12B; 262 144 inbyggda för Kolibri, validerade upp till 1 048 576 utan positionsskalning.
Så den ärliga formuleringen av "78B mot 12B" är att Kolibri vinner på aktiveringskostnad och förlorar på vikternas minnesavtryck, och ingen av fördelarna är gratis. En gles modell som aktiverar 3,46 miljarder parametrar per token måste fortfarande hålla alla 78 miljarder i minnet, vilket är anledningen till att minimikravet för driftsättning är ett par 80 GB-acceleratorer i stället för ett konsumentkort. Gemma 4 12B gör den motsatta avvägningen: en större andel av modellen aktiveras vid varje token, men den får plats på hårdvara som en person kan köpa.
Det finns en tyskspecifik egenhet på Kolibri-sidan som förändrar kalkylen snarare än rangordningen. Dess tokeniserare ger i genomsnitt 4,90 byte per token på tysk webbtext, jämfört med 4,13 för Gemini, 4,17 för Qwen3.5–3.8-familjen och 4,35 för GPT-5, enligt Aleph Alphas egna mätningar. Färre tokens per tyskt dokument är en direkt minskning av inferenskostnaden, och för en arbetsbelastning som består av miljontals tyska administrativa texter kan den effekten vara värd mer än några indexpunkter. Den är dessutom helt och hållet leverantörsrapporterad.

Vad var och en faktiskt kan se
Det är här matchen slutar vara jämn, och det är ett specifikationsfaktum snarare än ett kvalitetsanspråk. Gemma 4 12B är en enhetlig multimodal modell: dess kort beskriver en encoderfri arkitektur som projicerar råa bildpatchar och ljudvågformer direkt in i språkmodellens inbäddningsutrymme, med text, bild, tal och video in och text ut. Den är byggd för att köras på konsumentenheter utan att behöva provisionera separata encoders.
Kolibri läser text, på två språk, och inget annat. Aleph Alpha ramar medvetet in det som djup framför bredd: två språk, hårt kurerade, snarare än en bred flerspråkig mix. Det finns inget visionstorn, ingen ljudväg, ingen video. Om din arbetsbelastning omfattar skannade formulär, inspelade samtal eller fotografier av utrustning är Gemma 4 12B en kandidat och Kolibri inte, vad benchmarkraderna än säger. Om din arbetsbelastning är en korpus av tyska och engelska dokument som aldrig får lämna byggnaden, är det omvända närmare sanningen – men notera att kravet "aldrig lämnar byggnaden" också uppfylls av Gemma 4 12B, eftersom vikterna är Apache 2.0 och nedladdningsbara.
Vilken som är billigare beror på vad du köper.
De två modellerna är prissatta i valutor som inte kan växlas. Gemma 4 12B har en marknadskurs: $0,10 och $0,30 per miljon tokens, mätt över leverantörer av Artificial Analysis, och billigare på MoE-nivån på routade slutpunkter. Kolibri har ingen kurs alls, eftersom Aleph Alpha inte säljer inferens för den — släppet består av vikter, en teknisk rapport och ett modellkort.
• Gemma 4 12B på en hostad rutt — 0,10 $ per miljon indata och 0,30 $ per miljon utdata enligt siffrorna från Artificial Analysis. I vår egen katalog listas MoE-syskonet Gemma 4 26B-A4B IT till 0,06 $ in och 0,33 $ ut med ett fönster på 262 144 tokens, och den större täta modellen Gemma 4 31B IT till 0,13 $ och 0,38 $; dessa är leverantörens listpriser som förmedlas vidare, vilket är det enda beloppet vi inte lägger på något.
• Kolibri på din egen hårdvara – 78 GB vikter, ett vLLM-plugin från leverantörens aleph-alpha-inference-paket, och ett minimum av en H200 eller B200, eller ett par H100 SXM5. Kostnaden är en kapitalinvestering, en rackplats och en person som kan köra en vLLM-driftsättning, amorterad över så många tokens som du genererar.
Det är inte samma köp och jämförelsen handlar inte om "vilket som är billigast". Det handlar om huruvida arbetsbelastningen har en form som motiverar att äga hårdvaran. Ett team som bearbetar en fast, känslig dokumentkorpus i hög volym kan komma långt före med egen hosting. Ett team som bygger en produktfunktion som anropar en modell några miljoner tokens om dagen gör det nästan aldrig.
En praktisk mellanväg: Gemma-nivån finns på OrcaRouter idag, på samma OpenAI-kompatibla slutpunkt som allt annat, med redundansväxling mellan leverantörer och leverantörens listpris förs vidare utan något påslag per token. Det gör det till ett billigt sätt att mäta din faktiska tokenvolym på en hostad rutt innan du avgör om en suverän driftsättning på 78 GB är motiverad. Det är värt att säga rakt ut vad det inte är: vi routar inte Kolibri. Vi undersökte katalogen under varje stavning av leverantörens och modellens namn, och den finns inte där. Egen hosting är för närvarande det enda sättet att anropa den.

Vem ska välja vilken
Beslutsregeln är tillräckligt kort för att kunna uttryckas i tre rader.
Välj Gemma 4 12B om du behöver något annat än tysk och engelsk text, om du behöver en uppmätt kvalitetssiffra innan du bestämmer dig, om modellen måste köras på hårdvara du redan har, eller om du hellre hyr tokens än äger ett rack. Det är den enda av de två med en oberoende poäng, en publicerad hastighet och ett marknadspris.
Välj Kolibri om ditt krav är en resonemangsmodell med 78 miljarder parametrar vars vikter, träningsdatans härkomst, energiförbrukning och licens alla är dokumenterade, driftsatt inom din egen perimeter, med en tokeniserare byggd för tysk förvaltningsprosa och ett avståendebeteende som ett reglerat arbetsflöde kan lita på. Det är ett smalt mål och Aleph Alpha siktade medvetet på det.
Välj inte någon av dem på grundval av en benchmarkrad som du såg i ett lanseringsinlägg. Gemma 4 12B:s 14 är en mätning som någon annan har gjort och som du kan kontrollera. Kolibris 75,5 är ett påstående som dess upphovsperson har gjort, och den enda som för närvarande kan falsifiera det är en kund med två H100:or och en dokumentkorpus.
