Gegenereerde hero-kaart voor Kolibri vs Gemma 4 12B, met als kop 'Kolibri vs Gemma 4 12B' en de ondertitel 'een 78B MoE tegen een 11,95B dense model', een kolibrie-icoon links en een diamant rechts aan weerszijden van een dunne scheidingslijn. Het OrcaRouter-logo staat in de strook onder de afbeelding.
Guides & Insights

Kolibri vs Gemma 4 12B: 78 miljard parameters tegenover 12, en slechts één ervan heeft een score

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Kolibri en Gemma 4 12B vormen de twee uitersten van een spectrum dat open-weightreleases je gewoonlijk niet op gelijke voet laten vergelijken. Aleph Alpha's Kolibri verscheen op 3 oktober 2026: 78,1 miljard totale parameters, 3,46 miljard actief per token, een gevalideerd contextvenster van 1.048.576 tokens, alleen Duits en Engels, Apache 2.0. Gemma 4 12B verscheen op 3 juni 2026: 11,95 miljard dense parameters, een contextvenster van 262.144 tokens, tekst-, beeld-, audio- en video-invoer, Apache 2.0. Een van de twee heeft een onafhankelijke, publiek reproduceerbare score. De andere heeft een benchmarktabel van de leverancier. Die asymmetrie is geen voetnoot bij deze vergelijking; het ís de vergelijking, want al het andere waar een koper om geeft — kosten per taak, kwaliteit per watt, of het op uw documenten werkt — gaat er allemaal doorheen.

We moeten net zo direct zijn over de aard van de vergelijking, want een kop die een 78B-model tegenover een 12B-model plaatst, lokt de verkeerde conclusie uit. Dit zijn geen concurrenten. Het ene is een deployment van 78 GB, gericht op documentwerkzaamheden voor de Duitse publieke sector en de industrie op racks die de klant zelf bezit; het andere is een uniform multimodaal model met 12 miljard parameters dat op een laptop draait en een onafhankelijke index van 14 heeft. Wat volgt is een uiteenzetting van waar elk daadwerkelijk voor dient, waar de gepubliceerde cijfers je wel en niet in staat stellen om ze te rangschikken, en wat het kost om geen onafhankelijke score te hebben.

Het ene getal dat je hier kunt vertrouwen, en het getal dat je niet kunt vertrouwen

Artificial Analysis heeft Gemma 4 12B gemeten, in zijn redeneerconfiguratie. De bevindingen, zoals gepubliceerd op hun modelpagina, zijn de bevindingen waarmee moet worden gewerkt:

• Intelligentie — een Artificial Analysis Intelligence Index van 14, waarmee het in de topklasse-band terechtkomt met een #21-positie onder de 142 modellen in die vergelijking, tegenover een mediaan van 8 voor vergelijkbare modellen.

• Snelheid — 112,5 uitvoertokens per seconde, #21 van 142 in de snelheidsweergave, en boven de mediaan van 91 tokens voor vergelijkbare modellen.

• Prijs — $0,10 per miljoen inputtokens en $0,30 per miljoen output, wat op hun pagina wordt aangemerkt als enigszins duur tegenover een mediaan van $0,03 en $0,15 voor modellen van vergelijkbare grootte en klasse.

• Specificatie — context van 262.144 tokens, 12 miljard parameters in totaal, Apache 2.0, invoer van tekst, afbeeldingen, spraak en video, tekstuitvoer.

Het eigen samenvattende oordeel van Artificial Analysis is ongewoon bot voor een leaderboardpagina, en het is de moeite waard om te herhalen: Gemma 4 12B behoort tot de toonaangevende modellen op het gebied van intelligentie, maar is ietwat duur vergeleken met andere open-weight modellen van vergelijkbare grootte. Dat is een echte, onafhankelijke, reproduceerbare beoordeling van een derde partij die geen belang heeft bij een van beide leveranciers.

Kolibri heeft niets gelijkwaardigs. Er is geen modelpagina van Artificial Analysis voor, en op het moment van schrijven heeft geen enkele derde partij de evaluatiesuite gereproduceerd. Wat bestaat, is Aleph Alpha's eigen vergelijkingstabel, waarop Kolibri 75,5 scoort op het Engelse gemiddelde en 70,8 op het Duitse gemiddelde over zijn takenpakket. Dat zijn ongewogen procentuele gemiddelden over een benchmarkmix die de leverancier zelf heeft gekozen, op een harness die de leverancier heeft geschreven, bij reasoning effort high. Het zijn geen Intelligence Index, en de twee getallen kunnen niet naar elkaar worden omgerekend of naast elkaar worden gezet. Wie "Kolibri 75,5 versus Gemma 14" als een rangschikking presenteert, vergelijkt een percentage op de ene schaal met een score op een andere. De eerlijke positie is dat de kwaliteit van Gemma 4 12B gemeten is en die van Kolibri geclaimd.

Wat de leverancierstabel je wél laat doen, is over rijen heen lezen. Gemma 4 26B-A4B IT, Googles eigen mixture-of-experts-tegenhanger van de 12B, staat in de tabel van Aleph Alpha op 71,9 voor Engels en 66,3 voor Duits, op beide onder Kolibri. Dat is nog het dichtst bij een beschikbare kruiscontrole, en het gaat gepaard met dezelfde kanttekening: leveranciersopstelling, leverancierscijfers. Het is een zwak signaal, geen bewijs.

Screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), marked 'Open weights model, Released June 2026', showing an Intelligence Index of 14 against a median of 8, a #21/142 intelligence rank and a #21/142 speed rank, 112.5 output tokens per second against a 91-token median, input pricing $0.10 per million tokens against a $0.03 median and output pricing $0.30 against a $0.15 median, a 262k-token context window, the summary verdict that the model is amongst the leading models in intelligence but somewhat expensive compared with other open-weight models of similar size, and the 142 models in this class count.

Dense 12B tegenover sparse 78B is niet de mismatch die het lijkt.

Het verschil in architectuur is groter dan het verschil in parameters, zodra je meerekent wat er daadwerkelijk per token wordt berekend.

• Berekening per token — Gemma 4 12B activeert bij elke token alle 11,95 miljard parameters. Kolibri activeert 3.457.573.120 van zijn 78.103.074.560, ongeveer een tweeëntwintigste van het model, met één gedeelde expert en zes gerouteerde experts per laag van de 384.

• Geheugen — de afweging pakt de andere kant op en die is genadeloos. Gemma 4 12B in bfloat16 is in de orde van grootte van 24 GB aan gewichten. De kaart van Kolibri zet de FP8-gewichten op ongeveer 78 GB, met minimaal twee A100 80 GB-kaarten, twee H100 SXM5's, één H200, één B200 of één B300.

• Aandacht — Gemma 4 gebruikt een hybride van lokale sliding-window-attentie en volledige globale aandacht, waarbij de laatste laag altijd globaal is. Kolibri gebruikt een 4:1-verdeling van sliding-window naar gegroepeerde-query over 50 lagen die allemaal MoE zijn.

• Context — 262.144 tokens voor Gemma 4 12B; 262.144 native voor Kolibri, gevalideerd tot 1.048.576 zonder positie-schaling.

Dus de eerlijke framing van "78B tegen 12B" is dat Kolibri wint op activatiekosten en verliest op gewichtsvoetafdruk, en geen van beide voordelen is gratis. Een sparse model dat 3,46 miljard parameters per token activeert, moet nog steeds alle 78 miljard in het geheugen houden, en daarom ligt de ondergrens voor deployment bij een paar 80GB-accelerators in plaats van één consumentenkaart. Gemma 4 12B maakt de omgekeerde afweging: een groter deel van het model wordt bij elke token geactiveerd, maar het past op hardware die iemand kan kopen.

Er is een Duitsspecifieke eigenaardigheid aan de Kolibri-kant die de rekensom verandert, niet de rangschikking. De tokenizer ervan komt op Duitse webtekst uit op gemiddeld 4,90 bytes per token, tegenover 4,13 voor Gemini, 4,17 voor de Qwen3.5–3.8-familie en 4,35 voor GPT-5, volgens Aleph Alpha's eigen metingen. Minder tokens per Duits document is een directe verlaging van de inferentiekosten, en voor een werklast die voor miljoenen uit Duitse administratieve tekst bestaat, kan dat effect meer waard zijn dan een paar indexpunten. Het is bovendien volledig door de leverancier gerapporteerd.

Generated two-column scoreboard for Kolibri and Gemma 4 12B. Left column Kolibri: independent score 'none published', context '262,144 native, 1M validated', parameters '78.1B MoE, 3.46B active', modalities 'text only', licence Apache 2.0, price 'self-host, 78 GB'. Right column Gemma 4 12B: independent score 'AA Index 14', context 262,144, parameters '11.95B dense', modalities 'text, image, audio, video', licence Apache 2.0, price '$0.10 in / $0.30 out'. The footer reads 'Kolibri figures vendor-reported; Gemma 4 12B figures per Artificial Analysis.'

Wat elk van hen daadwerkelijk kan zien

Dit is het punt waarop de vergelijking niet langer nek-aan-nek is, en het is een feit over de specificaties in plaats van een kwaliteitsclaim. Gemma 4 12B is een uniform multimodaal model: de kaart beschrijft een encoder-vrije architectuur die ruwe beeldpatches en audiogolfvormen rechtstreeks in de embeddingruimte van het taalmodel projecteert, met tekst, beeld, spraak en video als invoer en tekst als uitvoer. Het is gebouwd om op consumentenapparaten te draaien, zonder afzonderlijke encoders te hoeven voorzien.

Kolibri leest tekst, in twee talen, en niets anders. Aleph Alpha positioneert dat bewust als diepte boven breedte: twee talen, sterk gecureerd, in plaats van een brede meertalige mix. Er is geen vision tower, geen audiopad, geen video. Als uw workload gescande formulieren, opgenomen gesprekken of foto's van apparatuur omvat, is Gemma 4 12B een kandidaat en Kolibri niet, wat de benchmarkrijen ook zeggen. Als uw workload een corpus van Duitse en Engelse documenten is die het gebouw nooit mogen verlaten, is het omgekeerde dichter bij de waarheid — maar let op: aan de eis dat iets "het gebouw nooit verlaat", wordt ook voldaan door Gemma 4 12B, aangezien de gewichten Apache 2.0 zijn en downloadbaar zijn.

Welke van de twee goedkoper is, hangt ervan af wat je koopt.

De twee modellen zijn geprijsd in valuta's die niet converteerbaar zijn. Gemma 4 12B heeft een markttarief: $0,10 en $0,30 per miljoen tokens, zoals gemeten bij verschillende providers door Artificial Analysis, en goedkoper op het MoE-niveau bij gerouteerde endpoints. Kolibri heeft helemaal geen tarief, omdat Aleph Alpha er geen inferentie voor verkoopt — de release bestaat uit gewichten, een technisch rapport en een modelkaart.

• Gemma 4 12B op een gehoste route — $0,10 per miljoen input en $0,30 per miljoen output volgens de cijfers van Artificial Analysis. In onze eigen catalogus staat het MoE-zustermodel Gemma 4 26B-A4B IT vermeld voor $0,06 input en $0,33 output met een tokenvenster van 262.144 tokens, en het grotere dense model Gemma 4 31B IT voor $0,13 en $0,38; dat zijn de doorgegeven lijstprijzen van de provider, het enige bedrag waaraan wij niets toevoegen.

• Kolibri op je eigen hardware — 78 GB aan gewichten, een vLLM-plugin uit het aleph-alpha-inference-pakket van de leverancier, en minimaal één H200 of B200, of een paar H100 SXM5's. De kosten bestaan uit een kapitaalaankoop, een plek in een rack en iemand die een vLLM-deployment kan draaien, afgeschreven over het aantal tokens dat je genereert.

Dat zijn niet dezelfde aankopen, en de vergelijking is niet "wat is goedkoper". Het gaat erom of de workload een vorm heeft die het bezit van de hardware rechtvaardigt. Een team dat een vaste, gevoelige documentencorpus met een hoog volume verwerkt, kan aan de self-hosted kant veel voordeliger uitkomen. Een team dat een productfunctie bouwt die een paar miljoen tokens per dag naar een model stuurt, komt bijna nooit voordeliger uit.

Een praktische middenweg: de Gemma-tier staat op OrcaRouter vandaag, op hetzelfde OpenAI-compatibele endpoint als al het andere, met failover tussen providers en de lijstprijs van de provider doorgegeven zonder dat er iets per token wordt toegevoegd. Dat maakt het een goedkope manier om je werkelijke tokenvolume op een gehoste route te meten voordat je besluit of een soevereine deployment van 78 GB gerechtvaardigd is. Het is de moeite waard om ronduit te zeggen wat het niet is: we routeren Kolibri niet. We hebben de catalogus onderzocht met elke spelling van de leveranciers- en modelnaam, en het staat er niet in. Zelfhosting is momenteel de enige manier om het aan te roepen.

Screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the 262K-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Google - 2026-04-05', the description of Gemma 4 26B A4B IT as an instruction-tuned mixture-of-experts model from Google DeepMind with roughly 26B total parameters of which about 4B activate per token, the pricing tiles $0.06 and $0.33, and the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Wie moet welke kiezen

De beslisregel is kort genoeg om in drie regels te formuleren.

Kies Gemma 4 12B als je iets anders nodig hebt dan Duitse en Engelse tekst, als je een gemeten kwaliteitscijfer nodig hebt voordat je je vastlegt, als het model moet draaien op hardware die je al hebt, of als je liever tokens huurt dan een rack bezit. Het is de enige van de twee met een onafhankelijke score, een gepubliceerde snelheid en een marktprijs.

Kies Kolibri als uw vereiste een redeneermodel met 78 miljard parameters is waarvan de gewichten, de herkomst van de trainingsgegevens, het energieverbruik en de licentie allemaal gedocumenteerd zijn, dat binnen uw eigen perimeter wordt ingezet, met een tokenizer die is gebouwd voor Duitse ambtelijke taal en een onthoudingsgedrag waarop een gereguleerde workflow kan vertrouwen. Dat is een smal doel, en Aleph Alpha heeft daar bewust op gemikt.

Kies geen van beide op basis van een benchmarkrij die je in een lanceringsbericht hebt gezien. De 14 van Gemma 4 12B is een meting die iemand anders heeft gedaan en die je kunt controleren. De 75,5 van Kolibri is een bewering van de auteur, en de enige die dit op dit moment kan weerleggen, is een klant met twee H100's en een documentcorpus.