
Ember-1 vs Gemma 4 12B: De ene verhuurt je minder tokens, de andere overhandigt je de gewichten
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Ember-1 en Gemma 4 12B concurreren niet om dezelfde regel op een inkooporder, en de snelste manier om te zien waarom is je af te vragen wat je aan het eind van elke maand zou bezitten. Gemma 4 12B is het dense multimodale model van Google met 11,95 miljard parameters, uitgebracht op 3 juni 2026 onder Apache 2.0 — je downloadt het, en het checkpoint is van jou. Ember-1 is Fireworks Research' gespecialiseerde afgeleide van Moonshot AI's Kimi K3, gepubliceerd op 23 september 2026 als een research preview op het eigen serverless platform van de leverancier — je roept het aan, en je bezit niets dan de factuur. Het ene is een rent-to-own-argument over tokens; het andere is een kapitaalaankoop. Zet ze naast elkaar en de nuttige vergelijking is niet welk model beter is, want niets dat gepubliceerd is, stelt je in staat dat te beslechten. Het is welke van de twee inkoopvormen past bij het ding dat je aan het bouwen bent.
De twee contracten, eenvoudig uitgelegd
Gemma 4 12B is een afgeronde open-weightsrelease. Google publiceert de gewichten, de architectuur, de benchmarktabel en de licentie, en een community van runtimes — llama.cpp, vLLM, MLX, SGLang, Transformers — draait het op hardware die jij beheert. De kosten van een token na aankoop zijn elektriciteit en afschrijving, geen kostenpost van een leverancier. De dingen die je opgeeft, zijn de dingen die open weights altijd kosten: je bent zelf verantwoordelijk voor capaciteitsplanning, en je kwaliteitsplafond ligt vast op 11,95 miljard parameters.
Ember-1 is de inverse. Er zijn geen gewichten om te downloaden — het bestaat als een serveeroptie op het eigen platform van de leverancier — en er is geen gepubliceerde prijs. Wat het in plaats daarvan biedt, is een beperktere claim, uitgevoerd bovenop een veel groter model: de nauwkeurigheid van Kimi K3, met ongeveer 40% minder tokens besteed om daar te komen. Fireworks Research heeft het specifiek getraind om redeneersporen te verkorten zonder de antwoorden te veranderen, en rapporteert dat de redeneerlengte met 35–50% kon worden verminderd zonder verlies van nauwkeurigheid in zeven benchmarks en twee A/B-tests in productie bij klanten. Elk cijfer daarin is door de leverancier gerapporteerd en niet gereproduceerd.

Wat het tokenargument waard is, hangt volledig af van wie voor de tokens betaalt
De pitch voor Ember-1 gaat uit van een factuur per token. Die aanname klopt voor het publiek waarvoor het is ontworpen — teams die lange agent-loops draaien tegen een gehost frontier-model, waar Fireworks Research opmerkt dat Kimi K3 meer dan 90% van de gegenereerde tokens aan interne redenering kan besteden, en waar elke beurt eerdere beurten opnieuw afspeelt, zodat eerdere redeneringen opnieuw worden gelezen en opnieuw in rekening worden gebracht. In die context is het verkorten van de trace-lengte een directe besparing op de maandelijkse factuur, en het A/B-resultaat van 29,9K outputtokens tegenover de 49,3K van K3 is het getal dat ertoe doet.
Draai hetzelfde model onder de voorwaarden van Gemma 4 12B en het argument vervalt. Wanneer je een Apache-2.0-checkpoint zelf host, kosten extra redeneertokens kloktijd en GPU-bezetting, geen dollars per miljoen. Een uitgebreide redeneertrace op je eigen 16GB-laptop is een langzamer antwoord, niet een hogere rekening. Dat maakt de inefficiëntie niet onschadelijk — in een agent-loop stapelt het zich nog steeds op, en het komt nog steeds tot uiting als latentie — maar de wisselkoers is anders, en een tokenreductie van 40% behandelen als een besparing van 40% op zelfgehoste hardware is een categoriefout.
Het specificatieblad, één regel per dimensie
• Wat het is — Ember-1: een onderzoekspreview-afgeleide van Kimi K3, opnieuw getraind voor kortere redeneringen. Gemma 4 12B: een dense open-weights multimodaal model van 11,95B uit de Gemma 4-familie van Google.
• Gewichten — Ember-1: geen enkele gepubliceerd; alleen aangeboden via het platform van de leverancier. Gemma 4 12B: Apache 2.0, downloadbaar, vrij toegankelijk.
• Grootte — Ember-1: niet bekendgemaakt; overgenomen van de architectuur van Kimi K3. Gemma 4 12B: 11,95B dense, 48 lagen, ongeveer 18GB aan gewichten in BF16.
• Contextvenster — Ember-1: niet gepubliceerd voor de preview; het basismodel bevat 1.048.576 tokens. Gemma 4 12B: 256K tokens.
• Invoer — Ember-1: tekst. Gemma 4 12B: tekst, afbeelding en audio via een encoderloos uniform ontwerp, met video die door sommige bronnen wordt genoemd.
• Prijs — Ember-1: geen gepubliceerd; de dollarbedragen in het benchmarkblad zijn berekend op basis van Kimi K3's tariefkaart. Gemma 4 12B: gratis te downloaden; je betaalt voor de hardware.
• Hardwareondergrens — Ember-1: wat de leverancier ook inplant. Gemma 4 12B: 16GB VRAM of unified memory, volgens de positionering van Google.
• Bewijs — Ember-1: leveranciersbenchmarks en twee door de leverancier uitgevoerde A/B-tests, niet gereproduceerd. Gemma 4 12B: door Google gerapporteerde evaluaties plus een onafhankelijk ecosysteem van lokale runs.
Wat Gemma 4 12B publiceert, en hoe het leest
De eigen cijfers van Google voor Gemma 4 12B plaatsen het tussen de op edge-formaat gerichte Gemma 4 E4B en de grotere 26B MoE: GPQA Diamond 78,8%, MMLU Pro 77,2%, AIME 2026 zonder tools 77,5%, LiveCodeBench v6 72,0, Codeforces ELO 1659, τ-2-gemiddelde 69,0%, MMMU Pro 69,1%, DocVQA 94,9 en BigBench Extra Hard 53,0%. Ook die zijn door de leverancier gerapporteerd — Google evalueerde zijn eigen model en publiceerde het scoreblad — maar ze hebben het voordeel dat ze een checkpoint beschrijven dat iedereen kan downloaden en opnieuw kan uitvoeren, waardoor open-weightsclaims doorgaans snel bevestiging van derden krijgen en claims over closed previews niet.
Het werkelijke onderscheid van dit model is structureel, niet numeriek. Gemma 4 12B heeft geen aparte vision- of audio-encoder: beeldpatches en audiogolven projecteren rechtstreeks in de tokenruimte, en dat is precies wat een 12B-model überhaupt in staat stelt een screenshot of een opname als invoer te nemen. Het wordt ook geleverd met multi-token-prediction-drafters voor speculatieve decoding, wat een latencyfunctie is in plaats van een kwaliteitsfunctie — het soort ding dat ertoe doet wanneer je het model zelf draait en elke milliseconde prefill voor jouw rekening is.
Waar de twee daadwerkelijk met elkaar in botsing komen
Beide modellen worden verkocht voor agentic coding en toolgebruik, en dit is het enige domein waar een echte keuze bestaat. Het Terminal Bench 2.1-cijfer van Ember-1 is 82,0% tegenover 80,9% voor Kimi K3 Max, met 51,9% minder tokens; het SWE-bench Verified-resultaat is 92,2% tegenover 93,2% voor K3 Max. Gemma 4 12B heeft helemaal geen Terminal Bench- of SWE-bench-cijfer in de door Google gepubliceerde set — het agentic bewijs is τ-2 op 69,0%. Je kunt de twee dus niet op een gedeelde benchmark naast elkaar zetten, en elk artikel dat dat wel doet, verzint de vergelijking.
Wat je kunt zeggen, is dat ze op verschillende punten op een kostencurve zitten. Als je agent-workload draait tegen een gehost frontier-model en de rekening wordt gedomineerd door reasoning-tokens, dan pakt Ember-1 precies die term aan — tegen de prijs van een toegangsvenster van twee weken en geen gepubliceerd tarief. Als je workload moet draaien op hardware die je zelf beheert, een screenshot moet verwerken, of moet overleven dat een leverancier besluit een preview niet voort te zetten, is Gemma 4 12B de enige van de twee die de vraag überhaupt beantwoordt.

Een middenweg, en waar je die kunt vinden
Er is een derde optie waarop de marketing van geen van beide modellen is gericht: gebruik de grotere Gemma 4-tiers als het gehoste deel van een hybride. OrcaRouter routeert Google's Gemma 4 26B-A4B en Gemma 4 31B naast 200+ andere modellen achter één API tegen de lijstprijs van de provider met 0% markup, zodat dezelfde sleutel die een middelgrote Gemma bereikt ook de frontier-modellen bereikt waarvoor je anders een tweede contract nodig zou hebben. Gemma 4 12B zelf staat niet op ons platform, en Ember-1 ook niet — als je de 12B lokaal nodig hebt, download hem dan; als je eerst wilt testen of een grotere Gemma het gat dicht, kost die test één endpoint.
Die opzet is ook de eerlijke manier om een research preview te evalueren. Automatische failover tussen providers betekent dat een model dat uit een previewvenster verdwijnt, je applicatie niet meeneemt, wat het specifieke risico is dat de releasestatus van Ember-1 introduceert en het specifieke risico dat niets in zijn benchmarktabel aanpakt.
Welke hoort er op jouw roadmap?
Kies Gemma 4 12B als eigenaarschap een vereiste is — privacy, offline werking, een vaste kostenondergrens, of een product dat moet blijven werken als een leverancier van gedachten verandert. Het gepubliceerde plafond ervan is lager dan dat van een frontier-derivaat en de multimodale input is echt onderscheidend, en geen van die twee feiten is afhankelijk van de roadmap van iemand anders.
Kies Ember-1 als je probleem een factuur per token is bij lange agent-runs en je het previewrisico kunt dragen. Draai het in schaduwmodus naast je huidige oplossing gedurende de twee weken die je hebt, meet tokens per voltooide taak op je eigen verkeer, en behandel de 40% als een hypothese in plaats van een percentage. Wat je niet moet doen, is op basis van kwaliteit tussen hen kiezen, want niemand — inclusief het lab dat Ember-1 heeft gebouwd — heeft een vergelijking gepubliceerd waarmee je dat zou kunnen.

Het belangrijkste punt is dat deze twee releases de twee manieren vertegenwoordigen waarop capaciteit eind 2026 wordt verkocht. Het ene lab publiceert een checkpoint en laat het ecosysteem zijn niveau vinden; een ander neemt een model dat iemand anders heeft getraind, verbetert één as van het gedrag ervan en verkoopt de verbetering als dienst. Beide zijn legitiem, en ze falen op verschillende manieren: open weights falen langzaam en in het openbaar, previews falen plotseling en via een aankondiging.
