Ett genererat titelkort med texten "Ember-1 vs Gemma 4 12B" och underrubriken "Färre tokens på en hyrd slutpunkt, eller dina egna vikter", ovanför två kort: Ember-1 — "Kimi K3-derivat" och "inga vikter, inget publicerat pris"; Gemma 4 12B — "11,95B dense, Apache 2.0" och "256K kontext, multimodal".
Guides & Insights

Ember-1 vs Gemma 4 12B: Den ena hyr ut färre tokens till dig, den andra räcker dig vikterna

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ember-1 och Gemma 4 12B konkurrerar inte om samma rad på en inköpsorder, och det snabbaste sättet att se varför är att fråga dig vad du skulle äga i slutet av varje månad. Gemma 4 12B är Googles täta multimodell med 11,95B parametrar, som släpptes den 3 juni 2026 under Apache 2.0 – du laddar ner den, och checkpointen är din. Ember-1 är Fireworks Researchs specialiserade derivat av Moonshot AI:s Kimi K3, som publicerades den 23 september 2026 som en forskningsförhandsvisning på leverantörens egen serverlösa plattform – du anropar den, och du äger inget annat än fakturan. Det ena är ett argument om hyrköp av tokens; det andra är ett kapitalinköp. Ställ dem sida vid sida, och den användbara jämförelsen är inte vilken modell som är bättre, för inget som har publicerats låter dig avgöra det. Det är vilken av de två anskaffningsformerna som passar det du bygger.

De två avtalen, i klartext

Gemma 4 12B är en färdig release med öppna vikter. Google publicerar vikterna, arkitekturen, benchmark-arket och licensen, och en gemenskap av körmiljöer – llama.cpp, vLLM, MLX, SGLang, Transformers – kör den på hårdvara du kontrollerar. Kostnaden för en token efter köp är el och avskrivning, inte en radpost från en leverantör. Det du ger upp är det som öppna vikter alltid kostar: du ansvarar för kapacitetsplaneringen, och ditt kvalitetstak är fast vid 11,95 miljarder parametrar.

Ember-1 är inversen. Det finns inga vikter att ladda ner – den finns som ett serveringsalternativ på leverantörens egen plattform – och inget publicerat pris. Vad den erbjuder i stället är ett snävare påstående, utfört ovanpå en mycket större modell: Kimi K3:s noggrannhet, med ungefär 40 % färre tokens för att komma dit. Fireworks Research tränade den specifikt för att förkorta resonemangsspår utan att ändra svar, och rapporterar att resonemangslängden kunde minskas med 35–50 % utan noggrannhetsförlust över sju benchmarks och två kunders produktions-A/B-tester. Varje siffra där är leverantörsrapporterad och ej reproducerad.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

Vad tokenargumentet är värt beror helt och hållet på vem som betalar för token.

Pitchen för Ember-1 förutsätter en fakturering per token. Det antagandet stämmer för den målgrupp den designades för – team som kör långa agentloopar mot en hostad frontier-modell, där Fireworks Research noterar att Kimi K3 kan lägga mer än 90 % av genererade tokens på internt resonemang, och där varje tur återuppspelar tidigare turer så att tidigare resonemang läses om och faktureras igen. I det sammanhanget är en kortare trace-längd en direkt minskning av månadsfakturan, och A/B-resultatet med 29,9K utdatatokens mot K3:s 49,3K är siffran som spelar roll.

Kör samma modell på Gemma 4 12B:s villkor och argumentet upplöses. När du självhostar en Apache-2.0-checkpoint kostar extra resonemangstokens väggklockstid och GPU-beläggning, inte dollar per miljon. Ett utförligt resonemangsspår på din egen 16 GB-laptop är ett långsammare svar, inte en större räkning. Det gör inte ineffektiviteten ofarlig – i en agentloop ackumuleras den fortfarande, och den visar sig fortfarande som latens – men växelkursen är en annan, och att behandla en 40 % tokenminskning som en 40 % besparing på självhostad hårdvara är ett kategorifel.

Specifikationsbladet, en rad per dimension

• Vad det är — Ember-1: ett forskningsförhandsvisningsderivat av Kimi K3, omtränat för kortare resonemang. Gemma 4 12B: en tät multimodal modell med öppna vikter på 11,95B från Googles Gemma 4-familj.

• Vikter — Ember-1: inga publicerade; tillhandahålls endast via leverantörens plattform. Gemma 4 12B: Apache 2.0, nedladdningsbar, utan åtkomstbegränsningar.

• Storlek — Ember-1: ej offentliggjord; ärvd från Kimi K3:s arkitektur. Gemma 4 12B: 11,95B tät, 48 lager, cirka 18 GB vikter i BF16.

• Kontextfönster — Ember-1: inte publicerad för förhandsvisningen; dess basmodell har 1 048 576 tokens. Gemma 4 12B: 256K tokens.

• Indata — Ember-1: text. Gemma 4 12B: text, bild och ljud genom en enkoderfri enhetlig design, med video som listas av vissa källor.

Pris — Ember-1: inget publicerat; dollarvärdena i benchmark-arket är beräknade utifrån Kimi K3:s prislista. Gemma 4 12B: gratis att ladda ner; du betalar för hårdvaran.

• Hårdvarugolv — Ember-1: vad leverantören än planerar. Gemma 4 12B: 16 GB VRAM eller enhetligt minne, enligt Googles positionering.

• Evidens — Ember-1: leverantörsbenchmark och två leverantörsdrivna A/B-tester, ej reproducerade. Gemma 4 12B: Goog​le-rapporterade utvärderingar plus ett oberoende ekosystem av lokala körningar.

Vad Gemma 4 12B publicerar, och hur den läser

Googles egna siffror för Gemma 4 12B placerar den mellan den edge-anpassade Gemma 4 E4B och den större 26B MoE: GPQA Diamond 78,8 %, MMLU Pro 77,2 %, AIME 2026 utan verktyg 77,5 %, LiveCodeBench v6 72,0, Codeforces ELO 1659, τ-2-genomsnitt 69,0 %, MMMU Pro 69,1 %, DocVQA 94,9 och BigBench Extra Hard 53,0 %. Även dessa är leverantörsrapporterade — Google utvärderade sin egen modell och publicerade resultatbladet — men de har fördelen att beskriva en checkpoint som vem som helst kan ladda ner och köra om, vilket är anledningen till att anspråk om öppna vikter tenderar att snabbt få tredjepartsbekräftelse, medan anspråk om stängda förhandsvisningar inte gör det.

Modellens faktiska särart är strukturell snarare än numerisk. Gemma 4 12B har ingen separat visions- eller ljudkodare: bildpatchar och ljudvågformer projiceras direkt in i tokenrymden, vilket är vad som gör att en 12B-modell överhuvudtaget kan ta en skärmbild eller en inspelning som indata. Den levereras också med utkastare för multi-token-förutsägelse för spekulativ avkodning, vilket är en latensfunktion snarare än en kvalitetsfunktion — den typ av sak som spelar roll när du kör modellen själv och varje millisekund av prefill är din att betala för.

Där de två faktiskt kolliderar

Båda modellerna marknadsförs för agentisk kodning och verktygsanvändning, och detta är det enda området där ett verkligt val existerar. Ember-1:s siffra för Terminal Bench 2.1 är 82,0 % mot Kimi K3 Max 80,9 %, med 51,9 % färre tokens; dess resultat i SWE-bench Verified är 92,2 % mot K3 Max 93,2 %. Gemma 4 12B har inte någon Terminal Bench- eller SWE-bench-siffra i Googles publicerade uppsättning alls — dess agentiska belägg är τ-2 på 69,0 %. Så man kan inte ställa de två mot varandra på ett gemensamt benchmark, och varje artikel som gör det hittar på jämförelsen.

Det man kan säga är att de befinner sig på olika punkter på en kostnadskurva. Om din agent-arbetsbelastning körs mot en hostad frontmodell och räkningen domineras av resonemangstoken, angriper Ember-1 exakt den posten – till priset av ett två veckor långt åtkomstfönster och ingen publicerad taxa. Om din arbetsbelastning behöver köras på hårdvara du kontrollerar, hantera en skärmbild, eller överleva att en leverantör beslutar sig för att inte fortsätta en förhandsvisning, är Gemma 4 12B den enda av de två som överhuvudtaget svarar på frågan.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

En medelväg, och var man hittar den

Det finns ett tredje alternativ som ingen av modellernas egen marknadsföring är uppbyggd kring: använd de större Gemma 4-nivåerna som den hostade halvan av en hybrid. OrcaRouter dirigerar Googles Gemma 4 26B-A4B och Gemma 4 31B tillsammans med 200+ andra modeller bakom ett enda API till leverantörens listpris med 0 % påslag, så samma nyckel som når en medelstor Gemma når även de mest avancerade modellerna som du annars skulle behöva ett andra avtal för. Själva Gemma 4 12B finns inte på vår plattform, och inte Ember-1 heller — om du behöver 12B lokalt, ladda ner den; om du först vill testa om en större Gemma stänger gapet, kostar det testet en slutpunkt.

Det upplägget är också det ärliga sättet att utvärdera en forskningsförhandsvisning. Automatisk redundansväxling mellan leverantörer innebär att en modell som försvinner från ett förhandsvisningsfönster inte tar din applikation med sig, vilket är den specifika risk som Ember-1:s utgivningsstatus medför och den specifika risk som inget i dess benchmarktabell tar upp.

Vilken hör hemma på din roadmap?

Välj Gemma 4 12B om ägande är ett krav – integritet, offline-drift, ett fast kostnadsgolv eller en produkt som måste fortsätta fungera om en leverantör ändrar sig. Dess publicerade tak är lägre än ett frontier-derivats, och dess multimodala indata är verkligen särskiljande, och inget av dessa faktum beror på någon annans färdplan.

Välj Ember-1 om ditt problem är en tokenbaserad faktura vid långa agentkörningar och du kan bära risken med förhandsversionen. Kör den i skuggläge mot din befintliga lösning under de två veckor du har, mät tokens per slutförd uppgift i din egen trafik och behandla 40 % som en hypotes snarare än en sats. Det du inte bör göra är att välja mellan dem utifrån kvalitet, eftersom ingen – inte ens labbet som byggde Ember-1 – har publicerat en jämförelse som skulle göra det möjligt för dig.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

Den större poängen är att dessa två lanseringar representerar de två sätt på vilka förmåga säljs i slutet av 2026. Ett labb publicerar en checkpoint och låter ekosystemet hitta sin nivå; ett annat tar en modell som någon annan har tränat, förbättrar en axel av dess beteende och säljer förbättringen som en tjänst. Båda är legitima, och de misslyckas på olika sätt: öppna vikter misslyckas långsamt och offentligt, förhandsversioner misslyckas plötsligt och genom tillkännagivande.